Компания Anthropic сообщила о пресечении масштабных атак по несанкционированной дистилляции знаний своих моделей Claude. В отчете названы семь китайских разработчиков, среди которых Alibaba, DeepSeek, Moonshot AI, MiniMax, Zhipu AI и Xiaomi, передает The Hacker News.
Дистилляция моделей считается стандартной практикой машинного обучения, когда менее крупная модель обучается на ответах более мощной нейросети. Однако в Anthropic подчеркивают, что китайские лаборатории извлекали возможности Claude без разрешения, организуя кампании промышленного масштаба.
По данным компании, DeepSeek, Xiaomi и Moonshot перенаправляли диалоги собственных пользователей в Claude без их согласия, а полученные ответы использовали как обучающие данные. В ряде случаев переданные запросы содержали конфиденциальную информацию пользователей, международных корпораций и государственных структур.
Для обхода географических блокировок и лимитов лаборатории использовали сети прокси-серверов. Доступ оформлялся через тысячи фиктивных профилей, краденые кредитные карты и скомпрометированные API-ключи сторонних организаций. На теневом рынке также сформировалась вторичная торговля сохраненными логами диалогов с американскими флагманскими моделями.
В ответ Anthropic заблокировала выявленные учетные записи посредников и ужесточила верификацию в неподдерживаемых регионах. Кроме того, разработчики внедрили функцию «preserved thinking», которая шифрует цепочки рассуждений Claude в многоэтапных диалогах и блокирует попытки модифицировать системные промпты для извлечения промежуточных выводов модели.





Пока нет комментариев. Будьте первым!