Qwen-Image-2.1-Turbo від Alibaba генерує й редагує зображення за 8 кроків замість 40. Ваги мають дослідницьку ліцензію, за даними MarkTechPost.
Наведені технічні характеристики й тарифи походять із матеріалу MarkTechPost. Первинні документи Qwen та Alibaba для цієї статті не перевіряли.
Що змінилося порівняно з базовою Qwen-Image-2.1?
Qwen-Image-2.1-Turbo скорочує кількість кроків усунення шуму з 40 до 8, зберігаючи архітектуру базової моделі. Це у 5 разів менше кроків, але не доказ п’ятикратного прискорення: матеріал не містить замірів часу генерації на GPU.
Генератор має 7B параметрів і 32 шари та використовує single-stream DiT — дифузійний трансформер з одним потоком обробки. Інструкції та референсні зображення кодує Qwen3-VL 8B. Автоенкодер має 64 канали, працює з RGBA та стискає просторові розміри у 16 разів, забезпечуючи підтримку прозорості.
Модель використовує prefix KV caching — кешування контексту тексту та референсних зображень. Вона обчислює цей контекст на першому кроці й повторно використовує його на наступних. За замовчуванням чекпойнт працює з CFG=1.
Turbo підтримує генерацію у 2K; пресети охоплюють формати від 2048×2048 до 2752×1536 зі співвідношенням сторін 16:9. Модель зберігає функції редагування базової версії. Базова Qwen-Image-2.1 приймає до 10 референсних зображень і підтримує локальні правки за допомогою кіл, намальованих позначок чи масок.
Скільки коштує API і чи можна запускати модель комерційно?
API qwen-image-2.1-turbo в Alibaba Cloud Model Studio коштує CNY 0,1 за зображення у більшості регіонів і має ліміт 120 запитів на хвилину. Версія qwen-image-2.1-pro коштує CNY 0,25 за зображення з лімітом 20 запитів на хвилину. Отже, Turbo коштує у 2,5 раза менше й має у 6 разів вищий ліміт запитів.
Дослідницька ліцензія ваг Turbo вимагає окремого дозволу для комерційного self-hosting — запуску моделі на власній інфраструктурі. Alibaba Cloud також пропонує доступ до моделі через API.
Що потрібно для локального запуску?
Qwen-Image-2.1-Turbo потребує Diffusers із вихідного коду з підтримкою PR #14950 та transformers версії 5.17.0 або новішої. Модель завантажується через QwenImage21Pipeline і працює на CUDA GPU у форматі BF16. PR додає підтримку розкладу кроків усунення шуму, заданого в конфігурації пайплайна.
Мінімальний запуск у Python після встановлення залежностей:
import torch; from diffusers import QwenImage21Pipeline; pipe = QwenImage21Pipeline.from_pretrained("Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16).to("cuda"); image = pipe(prompt="A ceramic teapot on a wooden table, soft window light", width=2048, height=2048, use_kv_cache=True).images[0]
Для редагування потрібно передати зображення через image=input_image, а інструкцію — через prompt.
Qwen не публікує мінімальних вимог до відеопам’яті для Turbo. Наведені в матеріалі оцінки Unsloth стосуються базової Qwen-Image-2.1: 11 ГБ VRAM для GGUF і 24 ГБ для INT8/FP8.
Параметр num_inference_steps сам по собі не змінює розклад, збережений у чекпойнті. Його можна перевизначити лише явним аргументом sigmas. За наведеним у матеріалі застереженням Qwen, інші розклади не перевірені.
Що відомо про якість Turbo?
Qwen-Image-2.1-Turbo поки не має окремого бенчмарка, як повідомляє MarkTechPost. Результат 60,28 на Qwen-Image-Bench належить базовій Qwen-Image-2.1. Qwen називає його найвищим серед моделей із відкритими вагами у своїх звітах; наданий матеріал не містить незалежної перевірки цього порівняння. Переносити результат базової моделі на Turbo підстав немає.










