Qwen-Image-2.1
Hugging Face: https://huggingface.co/Qwen/Qwen-Image-2.1, https://huggingface.co/Qwen/Qwen-Image-2.1-Turbo
GitHub: https://github.com/QwenLM/Qwen-Image-2.1
Website: https://qwen.ai/blog?id=qwen-image-2.1
Developer: Alibaba Cloud, Qwen team
Released: September 2026
Variants: Qwen-Image-2.1 (40 default denoising steps) / Qwen-Image-2.1-Turbo (8 denoising steps)
Parameters: 7B visual generation component, plus Qwen3-VL 8B text encoder
Resolution: native 2K, 2048x2048 default; recommended sizes include 2752x1536 and 1536x2752
Architecture: single-stream DiT, 32 layers, block-causal attention with prefix KV cache reuse; Qwen3-VL 8B text encoder; 64-channel RGBA VAE with 16x spatial compression; flow matching with Euler scheduler
License: Qwen Research License Agreement
Modalities: Text-to-Image + Image editing (up to 10 reference images), native RGBA transparency
Runs on: Desktop GPU, 24GB+ VRAM with model CPU offload
Formats: BF16 safetensors, Diffusers pipeline
On disk: Qwen-Image-2.1: 33.13GB (14.23GB transformer, 17.53GB text encoder, 1.35GB VAE) / Turbo: 32.49GB (14.23GB transformer, 17.53GB text encoder, 0.68GB VAE)