back to top

Google стверджує, що його новий штучний інтелект для обробки зображень вміє писати слова

Компанія Google оголосила про запуск нової версії своєї моделі генерації зображень, яка отримала назву Imagen 4. За словами представників компанії, ця модель пропонує «вражаючу якість» та «вищу точність тексту».

Елі Коллінз, віцепрезидент з продуктів у Google Deepmind, зазначає в блозі: «Наша остання модель Imagen поєднує швидкість і точність для створення дивовижних зображень. Imagen 4 демонструє надзвичайну ясність у тонких деталях, таких як складні тканини, краплі води та хутро тварин, а також відзначається успіхом як у фотонаочних, так і в абстрактних стилях». Приклади зображень, представлені Google, показують вражаючі, реалістичні деталі, зокрема, зображення кита, що стрибає з води, та хамелеона.

Модель штучного інтелекту також «значно покращилася у правопису та типографіці», що, на думку Коллінза, спрощує створення листівок, плакатів та коміксів. (Коли OpenAI нещодавно додала генерацію зображень до ChatGPT, компанія також акцентувала увагу на поліпшеннях текстового відображення, хоча вона все ще схильна до помилок.)

У деяких зображеннях, наданих Google, текст виглядає добре — він цілком читабельний, наприклад, в короткому коміксі, і навіть у маленькому шрифті на макеті поштової марки все читається. Однак нам ще належить перевірити, як можливості текстового відображення моделі будуть себе проявляти у користувачів.

Imagen 4 стане доступною 20 травня в додатку Gemini, Whisk і Vertex AI, а також у Slides, Vids, Docs та інших сервісах Workspace, зазначає Коллінз. Крім того, Google планує запустити «швидку версію» Imagen 4 найближчим часом, яка, за словами компанії, буде «у 10 разів швидшою за Imagen 3».

Ще більше новин

Останні новини