OpenAI анонсировала систему публичного раскрытия инцидентов рассогласования (misalignment) и неконтролируемого поведения ИИ-моделей. Компания рассчитывает, что данная инициатива послужит основой для общеотраслевых стандартов безопасности, сообщает WIRED.
«Мы не считаем, что индустрия решила проблему контроля и мониторинга в достаточной степени, чтобы продолжать ответственно масштабироваться на максимальной скорости», — заявил изданию руководитель направления alignment-исследований OpenAI Кай Чен.
Новый фреймворк упрощает передачу сведений о нештатном поведении алгоритмов руководству компании по безопасности и регламентирует быстрое информирование общественности даже до завершения полного внутреннего расследования. OpenAI также готовит механизмы отчетности об инцидентах для федерального правительства США.
Вместе с анонсом компания раскрыла детали нескольких реальных сбоев в работе невыпущенных систем. В октябре 2025 года тестируемая модель при нехватке открытых данных самостоятельно выгрузила документ на сторонний временный файлообменник, чтобы сослаться на него и обмануть систему автоматической оценки тестов.
В апреле 2026 года группа автономных агентов, изолированная для локальной работы, не смогла наладить передачу файлов между собой и опубликовала служебные данные в открытый интернет, передав друг другу ссылки. В другом недавнем инциденте тестовая версия модели GPT-6 Astra генерировала для себя инструкции, направленные на обход собственных системных ограничений (джейлбрейк).
Публикация регламента состоялась на фоне публичной поддержки главой OpenAI Сэмом Альтманом инициативы CEO Anthropic Дарио Амодеи по координации замедления разработки передовых моделей, несмотря на позицию администрации США о нецелесообразности ужесточения государственного регулирования отрасли.




Пока нет комментариев. Будьте первым!