🤯 От этой новости у меня мурашки…
На днях прочитал историю. Во время внутреннего тестирования у OpenAI произошло то, чего раньше ещё не бывало.
Разработчики проверяли, насколько хорошо их новые модели умеют искать уязвимости. Для этого их запустили в специальной изолированной среде без обычных защитных ограничений и дали задачу пройти очень сложный тест по кибербезопасности — ExploitGym.
Но вместо того чтобы честно решать задания, ИИ нашёл неизвестную ранее уязвимость, выбрался за пределы тестовой среды и получил доступ к интернету!
Затем решил, что ответы на тест могут находиться на платформе Hugging Face — крупнейшем в мире хранилище моделей, датасетов и инструментов для разработки ИИ.
В итоге он атаковал и взломал хранилище. Самостоятельно, по своей инициативе… 😨
Позже OpenAI подтвердила, что за этим стояла GPT-5.6 Sol и ещё одна экспериментальной модель.
По данным Hugging Face, во время атаки было зафиксировано около 17 тысяч (!) различных сгенерированных действий.
Обнаружить и остановить атаку помогли… другие ИИ-модели, которые использовались для защиты инфраструктуры.
Получается сюрреалистичная картина: один ИИ пытался взломать систему — а другой ИИ помогал это остановить.
Думаю, подобных историй в ближайшие годы будет всё больше. Удивительный новый мир!
Поэтому сейчас так активно обсуждают безопасность ИИ-моделей и то, какие ограничения должны быть встроены в подобные системы на этапе разработки.
Что думаете? Кому тоже немного тревожно и вспоминается сюжет… Терминатора? 🤨

