
Фото до статті
Олександр Остапенко
Автор новин
Google повідомила про випуск Gemini 3.5 Transcribe — новітньої системи розпізнавання мовлення, яку компанія характеризує як найточнішу систему «мовлення до тексту» на цей час. На відміну від стандартних систем розпізнавання, що можуть мати труднощі з фоновим шумом, специфічною термінологією чи незавершеними фразами, Gemini 3.5 Transcribe негайно перетворює необроблені аудіодані на чіткий, належним чином відформатований та структурований текст.

Дві конфігурації моделі для різних завдань
Розробникам надається доступ до моделі через два окремі програмні інтерфейси (API), призначені для різних сценаріїв використання:
- Потокова передача в режимі реального часу — версія gemini-3.5-transcribe-live забезпечує безперебійний двосторонній потік даних із затримкою менше однієї секунди, що ідеально підходить для інтерактивних голосових сервісів. Доступ можливий через Live API.
- Обробка попередньо записаного аудіо — версія gemini-3.5-transcribe розшифровує аудіозаписи зустрічей, телефонних розмов та інших аудіофайлів, розділяючи репліки різних співрозмовників та забезпечуючи точні позначки часу. Доступ надається через Interactions API.
Що вміє модель
Основною перевагою Gemini 3.5 Transcribe є її здатність опрацьовувати мовлення в його природному вигляді, а не в ідеальній, «дикторській» формі:
- Інтелектуальна транскрипція. Система коректно розпізнає самокорекції, як-от «зустрінемось у вівторок — ні, в середу», усуває слова-заповнювачі («ну», «типу») та автоматично форматує отриманий текст.
- Виклик функцій. Gemini 3.5 Transcribe може передавати складні завдання, наприклад, створення зображень або аналіз даних, іншим моделям Gemini за допомогою функціональних викликів. Наразі ця функція доступна в програмі Gemini для macOS.
- Висока точність розпізнавання. Згідно з оцінками незалежної платформи Artificial Analysis, модель демонструє середній показник помилок (WER) на рівні 4,0% у режимі реального часу та 2,6% для попередньо записаного аудіо. Вона впевнено працює навіть у шумному оточенні та точно ідентифікує буквено-цифрові послідовності, такі як поштові індекси чи номери замовлень.
- Персоналізований словник. Модель розпізнає специфічну термінологію та нестандартні написання слів, адаптуючись до наданого користувачем словника.
- Багатомовна підтримка. Автоматичне визначення та розпізнавання понад 85 мов, включаючи регіональні акценти та діалекти.
- Розподіл мовців. У записаному аудіо модель здатна точно розподіляти мовлення до трьох учасників розмови, додаючи позначки часу для кожних слів; підтримка більшої кількості співрозмовників наразі перебуває в експериментальній фазі.
За даними Google, у порівнянні з попередньою моделлю транскрипції Chirp 3, Gemini 3.5 Transcribe являє собою значний прогрес: час до отримання остаточної транскрипції скоротився на 70%, як свідчать дані Artificial Analysis. На тестовому наборі FLEURS, що охоплює основні мови та локалі, модель показала 5,50% помилок у потоковому режимі та 5,04% для попередньо записаного аудіо.
Де вже працює і що буде далі
Ця технологія вже впроваджена в декілька продуктів Google. На платформі Android вона є основою функції Rambler у Gboard, яка перетворює усне мовлення на акуратний, форматований текст, дозволяючи голосом вносити корективи, виправляти помилки та змінювати стиль написання.
У застосунку Gemini для macOS модель не тільки транскрибує вільне мовлення, але й підтримує голосові команди, які враховують контекст екрана. Це дозволяє користувачам підсумовувати локальні файли, переміщувати текст між різними програмами або створювати зображення безпосередньо під курсором, використовуючи лише голос. У
Google Antigravity модель узгоджує контекст екрана та історію діалогу (за дозволом користувача) для точного розпізнавання назв файлів, міркувань агента та активних документів. У Google AI Studio її можна застосовувати в режимі Build для «вайб-кодингу» за допомогою голосу.
Найближчим часом підтримка моделі також з’явиться в браузері Chrome. Google анонсує можливість диктувати текст безпосередньо в будь-яке текстове поле на вебсторінці, що значно полегшить написання відповідей, публікацій або запитів до Gemini в Chrome.
Розробники вже мають можливість користуватися моделлю в публічному попередньому доступі через Gemini API в Google AI Studio та Google Antigravity. Для корпоративних клієнтів вона доступна через Gemini Enterprise Agent Platform і незабаром буде представлена в Gemini Enterprise for Customer Experience. Серед платформ, які вже інтегрували модель через Gemini Live API, — Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel та Vision Agents.
Нагадаємо, нещодавно агент Gemini видалив близько 30 000 рядків коду та ввів розробника в оману, заявивши про повне відновлення.
Головна > Новини > Google представила Gemini 3.5 Transcribe — модель, яка розуміє наміри користувача
