Новые горизонты в мире языковых моделей
Присоединяйтесь к нашим ежедневным и недельным новостям, чтобы получать последние обновления и эксклюзивный контент о передовых разработках в области ИИ.
Что нового?
Сообщество исследователей ИИ продолжает находить новые способы улучшения крупных языковых моделей (LLMs). Самая последняя новинка — это новая архитектура, представленная учеными из Meta и Университета Вашингтона. Их техника, называемая Byte Latent Transformer (BLT), может стать важным шагом к созданию более универсальных и масштабируемых LLM.
Проблемы токенизации
Существующие LLM часто обучаются на фиксированном наборе токенов — предопределенных группах последовательностей байтов. Это создает несколько проблем:
- Модели эффективнее используют ресурсы, но возникают предвзятости, которые ухудшают их работу с незнакомыми токенами.
- Языки, имеющие небольшое представительство в интернете, могут значительно замедлять работу моделей.
- Использование токенов затрудняет выполнение задач на уровне символов.
Byte Latent Transformer (BLT)
BLT — это архитектура без токенизации, которая учится напрямую на сырых байтах, достигая при этом производительности моделей на основе токенов. BLT использует динамический метод, который группирует байты на основе их информационного содержания. Вот как это работает:
- Не имеет фиксированного словаря.
- Группирует произвольные байты в «патчи» с использованием мер энтропии.
- Состоит из трех блоков трансформеров: двух малых моделей кодировщика/декодировщика и одного большого «глобального трансформера».
Архитектура BLT
Кодировщик и декодировщик являются легковесными моделями. Кодировщик принимает сырые байты на вход и создает представления патчей, которые затем поступают в глобальный трансформер. Глобальный трансформер является основной рабочей лошадкой модели, предсказывая следующий патч в последовательности.
Преимущества BLT
BLT переопределяет компромисс между размером словаря и требованиями к вычислениям:
- Увеличение размерности словаря приводит к большему размеру токенов и увеличивает потребление ресурсов.
- BLT может сбалансировать вычислительные ресурсы в зависимости от сложности данных.
Результаты экспериментов
Исследователи провели эксперименты с BLT на моделях различного масштаба — от 400 миллионов до 8 миллиардов параметров. Вот некоторые из их основных находок:
- BLT соответствует по производительности модели Llama 3, используя на 50% меньше FLOPs во время вывода.
- Модели BLT оказались более устойчивыми к шумным входным данным и продемонстрировали улучшенные способности к пониманию на уровне символов.
- Эта архитектура лучше справляется с редкими паттернами в обучающем наборе данных.
Будущее BLT
Это только начало нового стандарта создания языковых моделей. Исследователи отмечают, что существующие библиотеки трансформеров все еще предназначены для токенизированных архитектур, что оставляет пространство для улучшений в программном и аппаратном обеспечении.
