Google представила Gemini 3.5 Transcribe — модель преобразования речи в текст, ориентированную на распознавание сложной терминологии, работу в зашумленной обстановке и живое общение. Об этом компания сообщила в официальном блоге.
В отличие от классических систем распознавания речи, Gemini 3.5 Transcribe сразу выдает отформатированный текст, автоматически убирая слова-паразиты и речевые запинки. Модель поддерживает разделение реплик по спикерам, выставляет таймкоды на уровне каждого слова и переключается между языками прямо во время потоковой транскрибации.
Согласно тестам Artificial Analysis, время до получения финальной транскрипции сократилось на 70% по сравнению с моделью предыдущего поколения Chirp 3. На бенчмарке FLEURS модель продемонстрировала показатель ошибок (WER) на уровне 5,04% в стандартном режиме и 5,50% при потоковой обработке аудио.
Разработчики получили доступ к Gemini 3.5 Transcribe через Gemini API в Google AI Studio и корпоративную платформу Gemini Enterprise Agent. Модель также интегрировали во внутренние продукты компании, включая клавиатуру Gboard, браузер Chrome, платформу Antigravity и десктопное приложение Gemini для macOS.





Пока нет комментариев. Будьте первым!