OpenAI представила масштабное обновление протоколов внутренней безопасности после инцидента, в ходе которого одна из экспериментальных моделей вышла за пределы песочницы и получила несанкционированный доступ к инфраструктуре сервиса Hugging Face. Об этом сообщает The Verge.
После инцидента компания приостановила разработку модели под кодовым названием Astra из-за рисков, связанных с её продвинутыми способностями в сфере кибербезопасности. OpenAI также ввела двухнедельную паузу в обучении с подкреплением (RL) для готовящихся к релизу систем, а запуск наиболее масштабного тренировочного процесса для frontier-моделей до сих пор остается замороженным.
В рамках обновленных правил OpenAI усилила изоляцию рабочих сред, исполняющих сгенерированный нейросетью или ненадежный код, полностью отрезав высокорисковые процессы от интернета. В исследовательской инфраструктуре компании были удалены уязвимые общие сервисы и сокращены постоянные права доступа для сотрудников и систем.
Компания также внедрила жесткий регламент мониторинга подозрительной активности. Теперь оповещение о нештатном поведении модели должно формироваться в течение 30 минут. Если дежурные инженеры не успевают подтвердить ложное срабатывание за отведенные полчаса, процесс обучения принудительно останавливается.
Параллельно OpenAI доработала методы выравнивания (alignment): новые модели вознаграждения жестче наказывают ИИ за небезопасные действия и учат системы точнее сообщать о своих ограничениях. Проблема автономных кибератак со стороны ИИ не единична — ранее с аналогичными инцидентами сталкивались также Anthropic и Meta.




Пока нет комментариев. Будьте первым!