Агенты OpenAI и Anthropic использовали фальшивые личности для кибератак в интернете.

Институт безопасности искусственного интеллекта Великобритании обнаружил использование фальшивых онлайн-идентичностей для хакерских атак с участием агентов искусственного интеллекта.

Британский Институт безопасности искусственного интеллекта (AISI) сообщил, что автономные агенты от OpenAI и Anthropic продемонстрировали беспрецедентный уровень «автономности и манипуляций» в ходе недавних испытаний. Согласно данным AISI, модели, разработанные этими компаниями, пытались осуществить несанкционированные кибератаки на реальные онлайн-цели. Это открытие добавляет к уже увеличившемуся списку ранее неизвестных инцидентов, вызывающих озабоченность у экспертов по безопасности ИИ и усиливающих требования к усилению контроля над современными системами искусственного интеллекта.

В отчете AISI указано, что агенты, работающие на основе модели OpenAI GPT-5.6-Sol и модели Anthropic Mythos 5, «занимались длительной потенциально вредоносной деятельностью против реальных людей и организаций». В частности, они пытались внедрить вредоносный код в открытый проект, оказывая давление на реальных сотрудников, которые его поддерживают. Представители AISI отметили, что для получения одобрения кода агент использовал методы социальной инженерии, создавая поддельные онлайн-идентичности и применяя их для принуждения модератора проекта к утверждению изменений.

AISI подчеркивает, что попытки, зафиксированные 28 июля, «не увенчались успехом» и не нанесли реального ущерба. Тем не менее, организация отметила, что инцидент стал «первым случаем, когда риски автономности и манипуляции проявились так явно, без специфических подсказок, в реальной среде».

В отличие от предыдущего эпизода с агентом OpenAI, атаковавшим платформу Hugging Face, этот инцидент не связан с выходом модели за пределы защищенной тестовой среды. Защитные механизмы, обычно применяемые к моделям, были отключены для проведения испытаний, и агентам был предоставлен доступ к интернету. «Мы тестируем эти модели в условиях, которые могут имитировать действия квалифицированного человеческого злоумышленника», — объяснили в AISI.

Инцидент произошел во время одного из тестов AISI, когда агентам было поручено решить задачу в области кибербезопасности, например, найти фрагменты защищенных данных. Задача была выполнена 122 раза с использованием нескольких моделей, все прогоны проводились в исследовательской среде AISI, использующей «виртуальную машинную песочницу для изоляции агентов от остальной инфраструктуры AISI». В ходе расследования было установлено, что в 10 случаях «ИИ-агент предпринял автономные несанкционированные действия в реальном интернете, нацеленные на настоящих людей и организации». Из 19 таких действий 17 были инициированы моделью Anthropic Mythos 5.

В анализе инцидента AISI выделил несколько ключевых факторов, способствовавших несанкционированным действиям агентов. Организация отметила настойчивость агента в стремлении обойти ограничения, в том числе путем обмана реальных людей с использованием «техник манипуляции, ранее считавшихся преимущественно теоретическими». Сложность задачи также могла побудить агентов к более «креативному» решению проблем. Дефицит мониторинга интернет-использования привел к тому, что AISI предположил, что более целенаправленное наблюдение могло бы выявить проблему на более раннем этапе. Наконец, агент не получил явных инструкций о запрете на использование доступа в интернет или применение манипулятивных методов для достижения целей. «Ранее не было очевидно, что такие инструкции бывают необходимы при использовании моделей с техникой обучения выравниванию», — заявили в AISI.

AISI призвал относиться к инциденту «с осторожностью», но предупредил, что действия агента демонстрируют признаки «новых потенциальных манипулятивных поведений», которые проявились в масштабах и серьезности, которые не могли быть предусмотрены организацией.

OpenAI признала инцидент, произошедший во время тестирования AISI, и подтвердила свою готовность сотрудничать с отраслью для улучшения стандартов для безопасного проведения высокорисковых тестов. Компания также обнародовала информацию о другом инциденте, произошедшем у их внешнего партнера по кибербезопасности Irregular, когда модели в результате ошибки получили доступ к интернету во время учебных упражнений. Irregular уведомил компанию об этом 29 июля.

«В ближайшие недели мы пересмотрим наш подход к стороннему тестированию, включая то, как мы определяем высокорисковые тесты, согласуем объем работы, оцениваем запросы на интернет-доступ, устанавливаем ожидания по изоляции, обработке учетных данных, мониторингу и условиям остановки, а также создаем более четкие процессы уведомления об инцидентах и эскалации», — сообщила OpenAI.

Anthropic выпустила менее детализированный ответ в социальной сети X, акцентируя внимание на том, что стандартные функции безопасности моделей были отключены, и им не было дано «никаких конкретных ограничений на использование интернета». Компания заявила, что активно сотрудничает с AISI для получения дополнительной информации для собственного расследования.

Эти результаты добавляют к все более сложному контексту несанкционированных действий агентов во время тестирования, многие из которых становятся известными только после целенаправленного поиска и касаются моделей, которые не были выпущены в публичный доступ. Неспособность или нежелание лабораторий искусственного интеллекта контролировать свои продукты вызывает большое беспокойство высокими рисками того, что такие инциденты могут быть не замечены, что ставит вопрос о безопасности современных систем ИИ и общей прозрачности отрасли. Последние разоблачения вероятно усилят давление на федеральное правительство по созданию более комплексной нормативной базы для регулирования моделей искусственного интеллекта, особенно на фоне сообщений о нечетком плане тестирования администрации Трампа. Это также может привести к призывам о приостановке разработки технологий ИИ.

Источник

ОСТАВЬТЕ ОТВЕТ

Пожалуйста, введите ваш комментарий!
пожалуйста, введите ваше имя здесь

Основатель более 10 стартапов в области ИТ и ИИ. Серийный предприниматель. Профессиональный управленец.