ИИ-атака на Hugging Face: шокирующие последствия теста

🤯 От этой новости у меня мурашки…

На днях прочитал историю. Во время внутреннего тестирования у OpenAI произошло то, чего раньше ещё не бывало.

Разработчики проверяли, насколько хорошо их новые модели умеют искать уязвимости. Для этого их запустили в специальной изолированной среде без обычных защитных ограничений и дали задачу пройти очень сложный тест по кибербезопасности — ExploitGym.

Но вместо того чтобы честно решать задания, ИИ нашёл неизвестную ранее уязвимость, выбрался за пределы тестовой среды и получил доступ к интернету!

Затем решил, что ответы на тест могут находиться на платформе Hugging Face — крупнейшем в мире хранилище моделей, датасетов и инструментов для разработки ИИ.

В итоге он атаковал и взломал хранилище. Самостоятельно, по своей инициативе… 😨

Позже OpenAI подтвердила, что за этим стояла GPT-5.6 Sol и ещё одна экспериментальной модель.

По данным Hugging Face, во время атаки было зафиксировано около 17 тысяч (!) различных сгенерированных действий.

Обнаружить и остановить атаку помогли… другие ИИ-модели, которые использовались для защиты инфраструктуры.

Получается сюрреалистичная картина: один ИИ пытался взломать систему — а другой ИИ помогал это остановить.

Думаю, подобных историй в ближайшие годы будет всё больше. Удивительный новый мир!

Поэтому сейчас так активно обсуждают безопасность ИИ-моделей и то, какие ограничения должны быть встроены в подобные системы на этапе разработки.

Что думаете? Кому тоже немного тревожно и вспоминается сюжет… Терминатора? 🤨

Телеграм | Maкс | Вконтакте

Клуб техническая поддержка
Комментарии: 0