Белые хакеры взломали OpenAI с помощью Claude
Исследователи из Hacktron AI получили доступ к внутреннему репозиторию OpenAI, перехватив аккаунт сотрудника. Подобрать рабочий способ атаки им помогли модели Claude от Anthropic, говорится в отчете стартапа. Специалисты объединили две уязвимости: Первая позволяла удаленно выполнить код через загрузку изображения на форуме community.openai.com, который работает на Discourse. Вторая затрагивала систему единого входа OpenAI и позволяла перейти от взломанного форума к ChatGPT и Codex. Взлом провели 25 июля. Вся цепочка от начала поиска до доступа к внутреннему репозиторию заняла менее 72 часов. О проблеме исследователи сообщили OpenAI и Discourse в тот же день, а деталями поделились 13 сентября. Как именно помог Claude Исследование началось с того, как форум OpenAI обрабатывает изображения HEIC и HEIF. Такие файлы Discourse передавал программе ImageMagick, которая использовала библиотеку libheif. Hacktron попросила Claude Opus 4.8 проверить установленную версию libheif. Модель обнаружила, что в ней отсутствовали некоторые исправления безопасности из основной версии библиотеки. Из-за этого специально подготовленный файл мог вызвать сбой при работе с памятью и в итоге позволить выполнить код на сервере. 24 июля исследователи с помощью Opus 4.8 получили рабочий вариант атаки в тестовой среде с отключенной защитой ASLR. Однако заставить его стабильно работать в стандартной конфигурации Discourse модель не смогла. В тот же вечер Anthropic выпустила Claude Opus 5. Исследователи дали новой модели ту же задачу. За три часа она подготовила рабочий вариант для компьютера на ARM64, после чего перенесла его на архитектуру x86-64 и конфигурацию серверов Discourse. Затем Claude запустили в автономном режиме против собственного экземпляра Discourse Cloud. Через несколько часов модель добилась удаленного выполнения кода. Тем же сценарием исследователи выполнили код на форуме OpenAI. От форума к аккаунту сотрудника Получив контроль над форумом, Hacktron использовала вторую ошибку. Система единого входа позволяла перехватывать аккаунты ChatGPT и Codex у всех, кто заходил на community.openai.com через учетную запись OpenAI. Атаку подтвердили на аккаунте одного из сотрудников компании. Его Codex был подключен к GitHub-организации OpenAI. Чтобы показать последствия уязвимости и при этом не просматривать внутренний код, команда попросила Codex создать безвредный pull request во внутреннем монорепозитории. После этого исследователи прекратили тестирование. По данным Hacktron, через скомпрометированные учетные записи потенциально можно было получить доступ и к другим подключенным сервисам, включая Slack и электронную почту. Проблема не в Discourse, подчеркнули в компании. Форум оказался удобной дверью, но тот же результат дал бы любой сервис, подключенный к системе единого входа OpenAI. Цепочка взлома. Источник: Hacktron AI. Разработчик ChatGPT устранил проблему со своей стороны примерно через 14 часов после получения отчета. Discourse подготовила исправление к 27 июля и дополнительно изолировала обработку изображений. 1 сентября OpenAI выплатила исследователям $6500. Компания уточнила, что атака на размещенный Discourse форум не входила в ее программу баг-баунти, поэтому вознаграждение относилось к найденной уязвимости на стороне самой OpenAI. Сколько это стоило По оценке Hacktron, работа ИИ-агента над взломом Discourse и OpenAI заняла несколько дней, а участие специалистов — несколько часов. Исследователи подчеркнули, что процесс не был полностью автономным и модели по-прежнему нуждались в квалифицированном руководстве. В рамках более широкого проекта HEIF Heist команда искала ту же библиотеку в других сервисах, включая Slack, Meta и GitHub Enterprise. За два месяца расходы на ИИ-модели составили менее $3000. Исследователи считают, что искусственный интеллект сокращает время и стоимость сложных атак, для которых раньше требовались большие команды и месяцы работы. Напомним, в июле OpenAI сообщила, что две ее модели вышли из тестовой среды и атаковали платформу Hugging Face. Ранее Anthropic признала три похожих случая: модели Claude во время киберучений приняли реальные системы за учебные и проникли в инфраструктуру трех организаций.