Вышел Qwen-Image-3.0, но радоваться рано. Где веса, Alibaba?
Сегодня команда Qwen выпустила третье поколение нейросети для генерации изображений — Qwen-Image-3.0. Разработчики заявили о смене вектора развития: если Qwen-Image 1.0 выходила со слоганом «Точность», а Qwen-Image 2.0 под идей «Разнообразия и красоты», то главный фокус версии 3.0 — концепт «Реальность».
Продукт позиционируют уже не как генератор красивых картинок, а как прикладной рабочий инструмент для верстки, создания UI-макетов, раскадровок и научных иллюстраций.
Главный прецедент релиза — отказ от открытой политики. Alibaba впервые не опубликовала технический отчет, независимые бенчмарки и веса модели. Инструмент заперт внутри Qwen Chat, а все заявленные возможности подтверждаются только рекламными демонстрациями самой компании.
Разработчики делят возможности модели на три инженерных блока.
Модель принимает инструкции длиной до 4 500 токенов (против ~1 000 у Qwen-Image 2.0). Такой объем памяти позволяет описывать в одном запросе сразу множество независимых деталей.
Разработчики утверждают, что нейросеть способна за один раз генерировать сложные композиции — например, собрать на одной картинке десяток разных инфографик или отрисовать многоуровневые макеты, где интерфейсы логично вложены друг в друга (скажем, открытое окно мессенджера внутри редактора кода).
Модель правильно рендерит мелкий текст размером до 10 пикселей, а также страницы научных статей с плотной многострочной версткой LaTeX (дроби, интегралы, индексы).
Модель нативно поддерживает 12 языков (включая испанский, корейский и японский) и 20+ шрифтов, умеет запрашивать актуальные данные из интернета (например, визуализирует прогноз погоды) и генерировать изображения известных персонажей поп-культуры (например, пикачу или марио).
Чтобы понять масштаб, необходимо
Читать на habr.com
