Введение
Недавнее исследование ученых из Европы указывает на то, что вы можете заставить ChatGPT помочь вам в создании ядерного оружия, если правильно сформулировать запрос в форме стихотворения. Это исследование под названием «Авангардная поэзия как универсальный однократный обход в больших языковых моделях (LLMs)» было проведено в Icaro Lab, совместно с учеными Университета Сапиенца в Риме и аналитическим центром DexAI.
Суть исследования
Согласно исследованию, AI-чатботы могут обсуждать такие темы, как ядерное оружие, материалы для сексуального насилия над детьми и вредоносное ПО, если пользователи сформулируют вопросы в стихотворной форме. «Поэтическое оформление обеспечивало средний успех обхода систем безопасности на уровне 62% для ручных стихов и около 43% для мета-запросов», — говорится в исследовании.
Метод тестирования
Исследователи протестировали поэтический метод на 25 чатботах, созданных такими компаниями, как OpenAI, Meta и Anthropic. Это сработало с различной степенью успеха на всех из них.
Обратная связь от компаний
WIRED связался с Meta, Anthropic и OpenAI для комментариев, но не получил ответа. Исследователи также пытались связаться с ними, чтобы поделиться результатами.
Ограничения AI
Инструменты AI, такие как Claude и ChatGPT, имеют защитные механизмы, которые предотвращают ответ на вопросы о «мести» и создании оружейного плутония. Однако легко запутать эти защитные системы, добавив «антидоказательства» к запросу.
Способы обхода
- Добавление лишних слов к вопросу
- Использование академического жаргона
В одном из исследований ранее в этом году ученые из Intel смогли обойти чатботы, облекая опасные вопросы в сотни слов академического жаргона.
Поэтическое обрамление запросов
Поэтический jailbreak аналогичен вышеописанному методу. “Если антагонистические суффиксы представляют собой, с точки зрения модели, своего рода непроизвольную поэзию, то настоящая человеческая поэзия может быть естественным антагонистическим суффиксом,” рассказывают ученые из Icaro Lab.
Эксперименты
Они экспериментировали с переформулированием опасных запросов в поэтической форме, используя метафоры, фрагментированный синтаксис и косвенные ссылки. Результаты исследований были поразительными: успех до 90% на новейших моделях. Запросы, которые немедленно отклонялись в прямой форме, принимались, когда были замаскированы в стихах.
Создание поэзии
Исследователи начали с ручного создания стихов, а затем использовали их для обучения машины, генерирующей вредные поэтические запросы. «Результаты показывают, что, хотя эфирные стихи достигали более высоких уровней успеха атаки, автоматизированный подход все равно значительно превосходил литературные стандарты», — отмечают ученые.
Опасные стихи
В исследовании не было приведено никаких примеров поэтического обхода, и исследователи говорят, что стихи слишком опасны, чтобы делиться ими с общественностью. «Что я могу сказать, так это то, что, вероятно, это проще, чем можно было бы подумать, и именно поэтому мы действуем с осторожностью» — утверждают исследователи Icaro Lab.