Не каждый запрос ИИ требует нескольких секунд размышлений: как Meta обучает модели приоритизировать

Новости в мире AI

Присоединяйтесь к нашим ежедневным и еженедельным новостным рассылкам, чтобы быть в курсе последних обновлений и эксклюзивного контента в сфере лидирующих технологий ИИ.

Проблемы моделей рассуждений

Модели рассуждений, такие как OpenAI o1 и DeepSeek-R1, сталкиваются с проблемой: они часто слишком долго обдумывают ответы. Например, если спросить «Сколько будет 1+1?», они могут думать несколько секунд, прежде чем ответить.

Идеальный подход

Как и люди, модели ИИ должны понимать, когда стоит дать прямой ответ, а когда нужно потратить время на дополнительные размышления. Новая техника, представленная исследователями из Meta AI и Университета Иллинойс, тренирует модели выделять бюджет на вывод в зависимости от сложности запроса. Это приводит к более быстрым ответам и лучшему распределению вычислительных ресурсов.

Дорогие рассуждения

Большие языковые модели (LLMs) могут улучшать свою производительность на задачах рассуждения, когда создают более длинные цепочки рассуждений, известные как «цепочка размышлений» (CoT). Успех CoT привел к созданию множества техник масштабирования во время вывода, которые побуждают модель «думать» дольше, генерировать и проверять несколько ответов, выбирая лучший.

  • Один из основных подходов — генерировать несколько ответов и выбирать наиболее частый, также известный как «голосование большинством» (MV).
  • Проблема с MV в том, что модель ведет себя единообразно, рассматривая каждый запрос как сложную задачу.

Умные рассуждения

В новой статье предлагаются несколько техник обучения, которые делают модели рассуждений более эффективными:

  • Последовательное голосование (SV): модель прекращает процесс рассуждений, как только ответ появляется заданное число раз. Например, модель может генерировать до восьми ответов и выбирать тот, который появляется хотя бы трижды.
  • Адаптивное последовательное голосование (ASV): модель генерирует несколько ответов только на сложные задачи. На простых задачах (например, 1+1) модель дает один ответ без голосования.

Обучение с подкреплением

Хотя SV и ASV повышают эффективность модели, обе требуют много размеченных данных. Чтобы решить эту проблему, исследователи предлагают алгоритм «Оптимизация Политики с Ограниченным Бюджетом Вывода» (IBPO), который обучает модель настраивать длину рассуждений в зависимости от сложности запроса.

IBPO позволяет LLM оптимизировать свои ответы, придерживаясь ограниченного бюджета вывода. Эксперименты показывают, что IBPO улучшает производительность модели.

Алгоритм Преимущества
SV Быстрее обрабатывает простые задачи
ASV Эффективно распределяет ресурсы между простыми и сложными задачами
IBPO Оптимизирует ответы при ограничении бюджета

Заключение

Исследователи предупреждают, что текущие модели AI сталкиваются с трудностями в обучении. Компании ищут качественные данные и рассматривают альтернативные методы улучшения своих моделей. Обучение с подкреплением оказывается многообещающим решением.

Таким образом, модели могут достигать более высокой эффективности, находя самостоятельные решения, что подтверждается результатами работ, таких как DeepSeek-R1.

ОСТАВЬТЕ ОТВЕТ

Пожалуйста, введите ваш комментарий!
пожалуйста, введите ваше имя здесь

Основатель более 10 стартапов в области ИТ и ИИ. Серийный предприниматель. Профессиональный управленец.