Исследователи Meta AI совместно с Иллинойсским университетом в Урбане-Шампейне разработали фреймворк EvoHarness-RL, который обучает языковые модели самостоятельно взаимодействовать со своей средой исполнения и памятью. Об этом сообщает VentureBeat.
При выполнении многочасовых задач — например, миграции корпоративных баз данных — ИИ-агенты зависят от внешней инфраструктуры (harness), предоставляющей логи, трекеры состояний и механизмы обработки ошибок. В стандартных системах правила взаимодействия с этой средой жестко задаются разработчиками вручную, из-за чего агенты лишь следуют скриптам и не могут гибко оценивать целесообразность своих действий.
Как пояснил соавтор исследования Сюйин Нин, ручная настройка логики требует постоянных инженерных затрат при каждой смене базовой модели. Кроме того, стандартный подход с простым накоплением контекста со временем перегружает память агента устаревшими выводами и следами неудачных попыток, что ухудшает качество его рассуждений.
EvoHarness-RL применяет обучение с подкреплением, позволяя агенту самостоятельно решать, когда считывать, перезаписывать или сжимать информацию о своем окружении. Фреймворк объединяет управление текущим состоянием, фиксацию промежуточных этапов и извлечение прошлого опыта в единый интерфейс, избавляя инженеров от необходимости вручную настраивать пошаговые инструкции.




Пока нет комментариев. Будьте первым!