Google DeepMind открыла разработчикам доступ к двум новым аудиомоделям — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Они уже доступны через Gemini API и Google AI Studio, сообщает The Decoder.
Модели ориентированы на создание голосовых ассистентов и поддерживают свыше 97 языков. Они способны параллельно обрабатывать визуальный поток с камеры, делать фоновые вызовы к внешним API и поддерживать непрерывный диалог. Исходный код демонстрационных приложений Google опубликовала на GitHub.
В рейтинге Speech-to-Speech аналитической платформы Artificial Analysis версия Extended Thinking набрала 82,6%, заняв первое место и опередив актуальную модель GPT-Live-1 от OpenAI.
Google установила стоимость на уровне $0,005 за минуту входящего аудио и $0,018 за минуту сгенерированной речи. В среднем час голосового общения обходится в $1,38. Для сравнения, OpenAI берет $0,05 за минуту взаимодействия с GPT-Live-1, что составляет от $3 за час работы.
Несмотря на ценовое преимущество и высокие баллы в тестах, GPT-Live-1 от OpenAI сохраняет преимущество в естественности звучания благодаря поддержке полноценного полнодуплексного режима (одновременного слушания и речи), отмечают обозреватели.





Пока нет комментариев. Будьте первым!