back to top

Остання модель штучного інтелекту Qwen створює та редагує зображення безкоштовно

Команда Qwen компанії Alibaba минулого тижня представила нову модель штучного інтелекту (ШІ) для генерації зображень. Названа Qwen VLo, ця модель є наступником Qwen 2.5 і має кілька вдосконалень у порівнянні з попередніми версіями. Остання модель підтримує як генерацію з тексту в зображення, так і зображення в зображення. Вона також здатна приймати текстові команди на кількох мовах, зокрема англійською та китайською. Окрім генерації зображень, модель ШІ може вносити зміни в вже згенеровані зображення, а також обробляти вхідні зображення.

Qwen VLo приймає команди на різних мовах

У публікації на платформі X (колишній Twitter) офіційний акаунт команди Qwen оголосив про вихід нової моделі. Технічна назва моделі – Qwen3-235B-A22B, і користувачі можуть безкоштовно користуватися нею через рекламний інтерфейс компанії. Також модель доступна без необхідності входу в систему.

Співробітники Gadget 360 провели тестування нової моделі ШІ і виявили, що її здатність до генерації зображень на рівні з Google’s Imagen 2. Якість виконання інструкцій і результуючих зображень трохи нижча, ніж у Imagen-3 та функції генерації зображень, що використовує технологію GPT-4 від OpenAI. Однак час генерації у Qwen VLo виявився більшим, а ліміт запитів — вищим.

На сторінці компанії в GitHub зазначається, що Qwen VLo має покращене розуміння зображень, що дозволяє їй краще виконувати зміни без спотворення структурної цілісності вхідного зображення. Це також підвищує загальну якість виходу. Модель краще реагує на неясні та відкриті команди, здатна створювати зображення, що відповідають очікуванням користувачів.

Крім генерації та редагування зображень, Qwen VLo може виконувати завдання, пов’язані з аннотуванням зображень, такі як виявлення контурів, сегментація, прогнозування карт та інші. Компанія повідомила, що майбутня версія моделі зможе приймати кілька вхідних зображень і комбінувати їх відповідно до запитів користувачів.

У новій моделі генератора зображень також поліпшено обробку тексту. Під час тестування моделі вдалося генерувати точний текст у різних шрифтах. Нарешті, Qwen VLo підтримує зображення з динамічними аспектними співвідношеннями, включаючи екстремальні, такі як 4:1 і 1:3. Компанія планує найближчим часом додати можливість генерувати зображення з різними аспектними співвідношеннями.

Ще більше новин

Останні новини