Anthropic объявила о выпуске Claude Opus 5. Новая модель уже доступна для пользователей платных подписок Claude Max, Claude Pro и разработчиков через API по цене предыдущей версии Opus 4.8.
По заявлению компании, Opus 5 практически достигает уровня флагманской Claude Fable 5, но стоимость ее работы в два раза ниже. Модель оптимизирована для повседневных задач, сложного программирования и глубокой аналитики. На отраслевых бенчмарках Frontier-Bench и GDPval-AA она показала новые рекордные результаты. Для ускорения работы также предусмотрен быстрый режим Fast, увеличивающий скорость генерации примерно в 2,5 раза.
Сравнение производительности и стоимости Claude Opus 5 с другими моделями
Графики эффективности показывают, что на бенчмарке CursorBench при максимальной нагрузке (max effort) Opus 5 отстает от флагманской Fable 5 всего на 0,5%, значительно превосходя другие модели по соотношению стоимости и качества выполнения ИТ-задач.
В тесте на решение нестандартных задач ARC-AGI-3 новая модель набрала в три раза больше очков, чем ближайший конкурент на рынке. Разработчики также обновили алгоритмы безопасности: согласно поведенческому аудиту Anthropic, Opus 5 реже других моделей совершает рискованные или вводящие в заблуждение действия, строго следуя внутренней «конституции» безопасности.
Результаты тестирования Claude Opus 5 на бенчмарках и соответствие стандартам безопасности
Данные тестирования указывают на высокую автономность ИИ. Например, в тестах Zapier модель без дополнительных подсказок выполнила полную цепочку удержания клиентов, а при разработке фронтенда запускала страницы в эмулируемом браузере, самостоятельно выявляла скрытые элементы разметки и исправляла ошибки перед выдачей результата.
В сфере кибербезопасности Opus 5 превосходит Opus 4.8 при поиске уязвимостей, однако в создании эксплойтов по-прежнему уступает модели Mythos 5.





Пока нет комментариев. Будьте первым!