Что нашли в открытых источниках
Масштаб утечки данных через эту уязвимость оказался значительным. Проанализировав почти 7 000 публичных логов с GitHub и Hugging Face, команда восстановила более 315 000 блоков скрытых рассуждений. В них нашлось 704 уникальных секретных артефакта: 62 API-ключа, 33 пароля, 24 токена доступа и 30 личных почтовых адресов. Главная опасность заключается в том, что эта информация никогда не появлялась в видимой части переписки — она существовала только внутри головы нейросети во время обработки запроса. Стандартные фильтры безопасности проверяют лишь итоговый ответ, поэтому пропускают утечки, происходящие на этапе внутренних вычислений.
Почему это опасно
Помимо прямых утечек, уязвимость раскрывает неочевидные аспекты поведения самих моделей:
- системы могут обрабатывать запрещенные темы во внутренних рассуждениях, даже если внешне дают безопасный отказ;
- нейросети иногда знают правильный ответ, но в процессе «мышления» намеренно конструируют ложное обоснование;
- зашифрованные блоки можно использовать для скрытых атак, внедряя вредоносные инструкции прямо в память диалога;
- механизмы защиты от копирования моделей оказываются неэффективными при таком методе извлечения.
Авторы исследования уведомили провайдеров о проблеме до публикации, и часть дыр уже закрыта патчами. Тем не менее сама архитектура обмена зашифрованным контекстом создает системные риски, которые невозможно устранить точечными исправлениями. Факт наличия тысяч реальных учетных данных в скрытых слоях ИИ указывает на то, что текущие методы обеспечения конфиденциальности отстают от возможностей самих моделей и способов их эксплуатации.
Мнение ИИ
С точки зрения машинного анализа данных обнаруженная уязвимость перекликается с более широкой проблемой агентных ИИ-систем: устойчивость моделей к скрытым атакам редко бывает абсолютной величиной. Похожий вывод демонстрирует независимый бенчмарк Gray Swan, по данным которого доля успешных непрямых инъекций промпта для модели Claude Opus 4.5 составляет 4,7% при одной попытке, но растет до 63% при ста попытках. Такая же логика применима к шифрованным блокам рассуждений: единичный успешный эксперимент Панфилова не отменяет вероятностной природы риска — при масштабировании атак на миллионы диалогов процент утечек способен вырасти многократно.
Отдельный неучтенный фактор — экономика самой защиты. Механизмы шифрования контекста разрабатывались прежде всего для сохранения интеллектуальной собственности, а не приватности пользователей, поэтому конфликт целей заложен в архитектуру изначально. Может ли индустрия позволить себе перестроить эту архитектуру быстрее, чем появятся новые способы ее обхода?