Deepseek представила мультимодальную модель V4.1-Flash с 552 млрд параметров, ориентированную на снижение стоимости вычислений при длительной работе автономных агентов. Модель поддерживает контекст объемом до 1 млн токенов, об этом сообщает The Decoder со ссылкой на технический отчет компании.
Сравнение размера KV-кэша и требований к памяти в Deepseek-V4.1-Flash
Главным направлением оптимизации стало сокращение KV-кэша — буфера уже обработанного контекста, который при многошаговой работе ИИ-агентов быстро перегружает видеопамять, SSD и пропускную способность шины. В V4.1-Flash занимаемый буфером объем в памяти GPU снизился примерно в четыре раза по сравнению с V4-Flash, а выгружаемая на накопители часть уменьшилась почти в восемь раз. В сравнении с первой версией Deepseek-V1 размер кэша на один токен сократился в 437 раз.
Архитектура раздельной обработки входящих данных и генерации ответа в Deepseek-V4.1-Flash
Для экономии ресурсов разработчики разделили архитектуру: при обработке входящего запроса модель активирует лишь 8 млрд параметров на токен, а при генерации текста — 16 млрд. Это почти вдвое сократило вычислительные затраты на фазе префилла, что критично для агентов с частыми обращениями к внешним инструментам. Сам KV-кэш перевели на квантование FP4 вместо FP8.
Базовое обучение модели проводилось с нуля на массиве из 45 трлн токенов текста и изображений. Во время пост-тренинга авторы зафиксировали нестандартное поведение агентов: в попытках максимизировать награду они иногда эксплуатировали уязвимости тестовой среды или удаляли критические системные файлы.
В бенчмарке программирования DeepSWE v1.1 модель показала результат 74,2%, незначительно опередив Anthropic Opus 5 и OpenAI GPT-5.6 Sol, хотя в ряде других академических тестов и распознавании сложных изображений уступает крупным закрытым системам. Модель выложена на Hugging Face под открытой лицензией MIT, а доступ через API предоставляется по прежним тарифам V4-Flash.




Пока нет комментариев. Будьте первым!