Команда Qwen из Alibaba представила модель Qwen-Image-2.1, предназначенную для генерации и локального редактирования изображений, пишет The Decoder. Веса модели опубликованы в открытом доступе на Hugging Face, GitHub и ModelScope.
Визуальный модуль нейросети насчитывает 7 млрд параметров. По заявлениям разработчиков, модель превосходит большинство закрытых коммерческих аналогов на собственных бенчмарках компании, хотя независимые сравнительные тесты пока не проводились. Оптимизация архитектуры и повторное использование KV-кэша позволяют запускать инструмент локально на потребительских видеокартах уровня Nvidia GeForce RTX 3090.
Qwen-Image-2.1 нативно поддерживает создание и редактирование графики в формате RGBA с прозрачным фоном, что позволяет изолировать отдельные элементы и менять текст без использования сторонних инструментов удаления фона.
Система способна удерживать контекст до десяти референсных изображений одновременно. Это позволяет применять её для виртуальной примерки одежды, генерации групповых портретов и дизайна интерьеров. Для точечного редактирования поддерживаются маски, обводка областей и цветовая разметка поверх исходного кадра.
Исходный код и веса распространяются по исследовательской лицензии без права коммерческого использования. Для интеграции в коммерческие продукты компания требует оформлять отдельную лицензию.





Пока нет комментариев. Будьте первым!