Подпишитесь на наши ежедневные и еженедельные информационные бюллетени, чтобы получать последние обновления и эксклюзивный контент о ведущих в отрасли технологиях искусственного интеллекта. Узнать больше
Улучшение возможностей больших языковых моделей (LLM) по оперативному извлечению информации остается областью активных исследований, которые могут повлиять на важные приложения, такие как генерация с расширенным поиском (RAG) и контекстное обучение (ICL).
Исследователи Microsoft Research и Университета Цинхуа представили дифференциальный трансформатор (Diff Transformer), новую архитектуру LLM, которая повышает производительность за счет усиления внимания к соответствующему контексту и одновременной фильтрации шума. Их результаты, опубликованные в исследовательской статье, показывают, что Diff Transformer превосходит классическую архитектуру Transformer в различных условиях.
Трансформеры и феномен «потерянного посередине»
Архитектура Transformer является основой большинства современных программ LLM. Он использует механизм внимания для взвешивания важности различных частей входной последовательности при генерации выходных данных. Механизм внимания использует функцию softmax, которая нормализует вектор значений в распределение вероятностей. В Transformers функция softmax присваивает оценки внимания различным лексемам во входной последовательности.
Однако исследования показали, что Трансформерам сложно получить ключевую информацию из длительного контекста.
«Мы начали с исследования так называемого феномена «потерянного посередине», — рассказал VentureBeat Фуру Вей, менеджер по исследованиям партнеров Microsoft Research, ссылаясь на результаты предыдущих исследований, которые показали, что программы LLM «не активно используют информации в длинных контекстах ввода» и что «производительность значительно снижается, когда модели должны получать доступ к соответствующей информации в середине длинных контекстов».
Вэй и его коллеги также заметили, что некоторые галлюцинации LLM, когда модель выдает неправильные результаты, несмотря на наличие соответствующей контекстной информации, коррелируют с ложными моделями внимания.
«Например, большие языковые модели легко отвлекаются на контекст», — сказал Вэй. «Мы проанализировали модели внимания и обнаружили, что внимание Трансформатора имеет тенденцию чрезмерно уделять внимание нерелевантному контексту из-за узкого места softmax».
Функция softmax, используемая в механизме внимания Transformer, имеет тенденцию распределять оценки внимания по всем токенам, даже тем, которые не имеют отношения к задаче. Это может привести к тому, что модель потеряет фокус на наиболее важных частях входных данных, особенно в длинных контекстах.
«Предыдущие исследования показывают, что внимание softmax склонно к изучению низкочастотных сигналов, поскольку показатели внимания softmax ограничены положительными значениями и должны быть суммированы до 1», — сказал Вэй. «Теоретическое узкое место делает [it] так что классический Трансформер не может научиться разреженному распределению внимания. Другими словами, показатели внимания имеют тенденцию выравниваться, а не сосредотачиваться на соответствующем контексте».
Дифференциальный трансформатор

Чтобы устранить это ограничение, исследователи разработали Diff Transformer, новую базовую архитектуру для LLM. Основная идея заключается в использовании механизма «дифференцированного внимания», который подавляет шум и усиливает внимание, уделяемое наиболее важным частям входных данных.
Трансформатор использует три вектора для вычисления внимания: запрос, ключ и значение. Классический механизм внимания выполняет функцию softmax для всего запроса и ключевых векторов.
Предлагаемое дифференциальное внимание работает путем разделения векторов запроса и ключей на две группы и вычисления двух отдельных карт внимания softmax. Разница между этими двумя картами затем используется в качестве оценки внимания. Этот процесс устраняет общий шум, побуждая модель сосредоточиться на информации, имеющей отношение к входным данным.
Исследователи сравнивают свой подход с наушниками с шумоподавлением или дифференциальными усилителями в электротехнике, где разница между двумя сигналами нейтрализует синфазный шум.
Хотя Diff Transformer включает в себя дополнительную операцию вычитания по сравнению с классическим Transformer, он сохраняет эффективность благодаря методам распараллеливания и оптимизации.
«В экспериментальной установке мы сопоставили количество параметров и FLOP с трансформаторами», — сказал Вэй. «Поскольку базовым оператором по-прежнему является softmax, он также может извлечь выгоду из широко используемых ядер FlashAttention cuda для ускорения».
Оглядываясь назад, метод, используемый в Diff Transformer, кажется простым и интуитивно понятным решением. Вэй сравнивает его с ResNet, популярной архитектурой глубокого обучения, которая ввела «остаточные связи» для улучшения обучения очень глубоких нейронных сетей. Остаточные соединения внесли очень простое изменение в традиционную архитектуру, но оказали глубокое влияние.
«В исследовании главное — выяснить, в чем состоит правильная проблема?» — сказал Вэй. «Как только мы сможем задать правильный вопрос, решение часто будет интуитивно понятным. Как и в ResNet, остаточная связь представляет собой сложение по сравнению с вычитанием в Diff Transformer, поэтому исследователям не сразу было очевидно, что можно предложить эту идею».
Дифференциальный трансформатор в действии
Исследователи оценивали Diff Transformer на различных задачах языкового моделирования, масштабируя его с точки зрения размера модели (от 3 миллиардов до 13 миллиардов параметров), обучающих токенов и длины контекста (до 64 000 токенов).
Их эксперименты показали, что Diff Transformer неизменно превосходит классическую архитектуру Transformer в различных тестах. Diff Transformer с 3 миллиардами параметров, обученный на 1 триллионе токенов, показал стабильные улучшения на несколько процентных пунктов по сравнению с моделями Transformer аналогичного размера.
Дальнейшие эксперименты с моделями разных размеров и размерами наборов обучающих данных подтвердили масштабируемость Diff Transformer. Их результаты показывают, что в целом Diff Transformer требует лишь около 65% размера модели или обучающих токенов, необходимых классическому Transformer для достижения сопоставимой производительности.

Исследователи также обнаружили, что Diff Transformer особенно эффективен при использовании контекстов увеличения длины. Оно показало значительные улучшения в поиске ключевой информации, уменьшении галлюцинаций и контекстном обучении.
Хотя первоначальные результаты являются многообещающими, еще есть возможности для улучшения. Исследовательская группа работает над масштабированием Diff Transformer для моделей большего размера и наборов обучающих данных. Они также планируют распространить его на другие модальности, включая изображения, аудио, видео и мультимодальные данные.
Исследователи выпустили код Diff Transformer, реализованный с различным вниманием и механизмами оптимизации. Они считают, что эта архитектура может помочь повысить производительность различных приложений LLM.
«Поскольку модель может более точно учитывать соответствующий контекст, ожидается, что эти языковые модели смогут лучше понимать контекстную информацию с меньшим количеством контекстных галлюцинаций», — сказал Вэй. «Например, для настроек генерации с расширенным поиском (таких как Bing Chat, Perplexity и индивидуальные модели для конкретных областей или отраслей) модели могут генерировать более точные ответы, настраивая полученные документы».