back to top

Тепер доступна можливість випробувати створення аудіодіалогів в Gemini 2.5

Компанія Google представила нові можливості генерації аудіо з моделями Gemini 2.5 на заході Google I/O 2025. Технологічний гігант із Маунтін-В’ю тепер надає можливість розробникам і користувачам протестувати ці функції на своїй платформі. Дві нові можливості включають нативний аудіо-діалог і контрольовану синтезацію мовлення (TTS) з попереднім переглядом Gemini 2.5 Flash. Перший з них може безпосередньо генерувати аудіо, схоже на людське, у відповідь на запити користувача, тоді як другий здатний перетворювати будь-який текст на розмовну мову. Ці функції наразі недоступні для розробників через інтерфейси програмування додатків (API).

Google демонструє можливості аудіовиходу Gemini 2.5 Flash

У блозі компанії було детально описано можливості цих двох режимів генерації аудіо, підкреслюючи, як розробники можуть їх використовувати для створення нових вражень для користувачів. Наразі нативний аудіо-діалог можна протестувати у вкладці потоку Google AI Studio, тоді як функцію TTS можна випробувати у вкладці генерації медіа в AI Studio.

Нативний аудіо-діалог з попереднім переглядом Gemini 2.5 Flash розроблений для реальних розмов між користувачем та ШІ. Користувач може ввести запит або висловити його усно, а ШІ відповідає усно. Цей процес безпосередньо генерує аудіо, замість того щоб спочатку створювати текст, а потім перетворювати його на мову.

Це має кілька переваг. Він підтримує емоційний діалог, що означає, що коли Gemini 2.5 Flash реагує на тон голосу користувача, він може розпізнавати емоції за сказаними словами. Він здатний розуміти, коли користувач звучить наляканим, сердитим або здивованим, і відповідати відповідно.

Крім цього, функція генерації аудіо може виражати емоції під час мовлення, залучати різні акценти та мовні стилі, мати доступ до інструментів, таких як Google Search, підтримує понад 24 мови.

Щодо контрольованої функції TTS, вона пропонує генерацію діалогів з кількома спікерами, може продукувати емоції та акценти під час оповіді, контролювати швидкість подачі та акцентувати вимову, а також підтримує ті ж 24 мови і змішування мов.

Google зазначає, що ці можливості були перевірені на потенційні ризики протягом розробки. Компанія використала як внутрішні механізми, так і вибіркову перевірку для виявлення та виправлення будь-яких вразливостей. Також було підкреслено, що всі аудіовиводи з цих моделей містять SynthID — технологію водяних знаків компанії.

Ще більше новин

Останні новини