Microsoft AI представила MAI-Transcribe-2 — новую модель распознавания речи, которая, по заявлению компании, превосходит решения от OpenAI, Google и ElevenLabs по скорости, точности и стоимости. Об этом сообщает VentureBeat.
Стоимость обработки аудио составляет 10 центов за час записи, что на 72% дешевле по сравнению с моделью предыдущего поколения MAI-Transcribe-1.5, стоившей $0,36 за час. Нейросеть поддерживает 60 языков и оптимизирована для сложных условий: фонового шума, перебивающих друг друга голосов и низкого качества записи в кол-центрах.
В базовый тариф корпорация включила функции, за которые специализированные провайдеры обычно берут отдельную плату. Среди них — диаризация спикеров, таймкоды на уровне отдельных слов, поддержка словарей терминов (keyword biasing) и автоматическое определение языка. Модель также умеет обрабатывать смешанную речь, когда собеседники переключаются между языками в рамках одной фразы, и поддерживает два режима вывода текста: дословный для юридических задач или очищенный от слов-паразитов.
На бенчмарке FLEURS модель продемонстрировала средний уровень пословной ошибки (WER) в 5,2% по 60 языкам. Релиз стал частью стратегии Microsoft по созданию собственной линейки базовых моделей и постепенному отказу от зависимости от технологий OpenAI в своих сервисах. MAI-Transcribe-2 уже доступна в каталоге Microsoft Foundry и тестовой среде MAI Playground.





Пока нет комментариев. Будьте первым!