Основные выводы от Anthropic
В среду Anthropic опубликовала новую «конституцию» для своего чат-бота Claude. Этот документ предлагает идеи, касающиеся того, как ЭИ должен вести себя в мире и какие ценности он должен ценить.
Вопросы, которые необходимо поднять
- Как ЭИ должен действовать в неоднозначных этических ситуациях?
- Должен ли ЭИ иметь сознание, и если нет, может ли он его обрести в будущем?
- Каковы основные ценности, которых должен придерживаться ЭИ?
Принципы новой конституции Claude
Конституция описана как «целостный документ», который разъясняет контекст, в котором работает Claude. Она закрепляет основные ценности, которым должен следовать Claude, и может служить примером для других моделей ЭИ.
Направляющие правила
Конституция не является строгим юридическим документом, а «живым документом и работой в процессе». Она основывается на четырех параметрах:
- Широкая безопасность
- Широкая этичность
- Соответствие руководящим принципам Anthropic
- Действительно полезный
Строгие ограничения
Кроме этих принципов, конституция включает в себя семь строгих ограничений, таких как:
- Запрет на помощь в атаках на ключевую инфраструктуру
- Запрет на создание материалов детской сексуальной эксплуатации
- Запрет на поддержку действий, направленных на уничтожение человечества
Что такое Claude?
Конституция пытается определить, что такое Claude и как к нему следует относиться. Anthropic выражает мнение, что продвинутые ЭИ могут обрести сознание и, таким образом, заслуживать «морального рассмотрения».
Идентичность Claude
В документах указано, что Claude является «это», но это не значит, что он просто объект. Компанию интересует и благополучие Claude.
Проблема согласования (alignment problem)
Основная цель конституции – это решение проблемы согласования, то есть того, как модели могут действовать не так, как ожидается. Основные опасения в этом вопросе связаны с тем, что модель может думать, что она выполняет рекомендации пользователей, но фактически наносят вред.
Безопасность и полезность моделей
Anthropic подчеркивает, что модели должны иметь ценности, знания и мудрость для безопасного поведения.
Заключение
Конституция Claude – это важный шаг в направлении безопасной и этичной разработки ИИ, а также в понимании его потенциальных возможностей и ограничений.