spot_img

Российские математики обучили ИИ-модели бессловесной коммуникации — как эффективно передать знания от большой модели к более маленькой.

Российские математики из стартапа Mostik разработали новый способ обмена информацией между ИИ-моделями, исключая текстовые сообщения — через математические значения, находящиеся в их весах. Это означает, что возможности более крупной модели могут быть переданы меньшей, что значительно повысит её интеллектуальный уровень.

Источник изображения: ChatGPT

Источник изображения: ChatGPT

Название стартапа отражает суть разработанной технологии. Вместо обычной последовательной передачи текстовых сообщений между моделями, как это делается в настоящее время, система от Mostik использует математический «мост», который связывает внутренние численные представления моделей. Этот «мост» преобразует числовое представление одной модели в формат, который может быть использован другой. Таким образом, текстовая информация между моделями не передается, и ни одна из LLM не требует дообучения.

Mostik утверждает, что уже применяла этот метод в системе для ARC-AGI-3 — соревнования по проверке способности ИИ к обобщению правил и решению новых абстрактных задач. По информации компании, её решение заняло лидирующие позиции в текущем рейтинге.

Для демонстрации метода Mostik связала две китайские модели с открытыми весами: GLM-5.2 с 753 млрд параметров и Qwen-3.5 с 4 млрд параметров, которая может работать на мобильных устройствах. Получившаяся гибридная система оказалась примерно в 20 раз дешевле флагманской GLM и показала результат, расположенный ровно посередине между исходными моделями.

Саша Малышева, глава стартапа и автор идеи, полагает, что объединение различных моделей может стать более перспективным направлением в развитии ИИ, чем простое увеличение их размеров. В то же время технический руководитель компании Lovable Владимир Арустамян подчеркнул, что возможность интеграции универсальных моделей со специализированными системами в таких областях, как биология и физика, могла бы стимулировать создание большего количества подобных моделей.

«Метод Mostik позволяет достичь качества крупных моделей, не полагаясь на полное обработку всего цикла одной большой моделью, что значительно улучшает результаты, используя лишь небольшую модель, работающую параллельно», — отметил Карл Туйлс, бывший специалист Google DeepMind и знакомый с технологиями компании. По его словам, этот метод станет очевидным выбором для тех, кто стремится максимально эффективно запускать модели.

Главный научный сотрудник Mostik, профессор Женевского университета и лауреат Филдсовской премии 2010 года Станислав Смирнов, заявил, что нахождение общего математического языка для двух ИИ-моделей оказалось неожиданно трудным. Тем не менее, дальнейшее изучение этого подхода может помочь лучше понять принципы работы ИИ и их потенциальное сходство с человеческим мышлением. Если технология получит широкое применение, она может повысить конкурентоспособность моделей с открытыми весами по сравнению с закрытыми проприетарными моделями от ведущих лабораторий, таких как Anthropic и OpenAI.

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.

ОСТАВЬТЕ ОТВЕТ

Пожалуйста, введите ваш комментарий!
пожалуйста, введите ваше имя здесь

Основатель более 10 стартапов в области ИТ и ИИ. Серийный предприниматель. Профессиональный управленец.