Баку, 27 августа, АЗЕРТАДЖ
Гонконгская компания Votee AI разрабатывает модели искусственного интеллекта, используемые на кантонском диалекте, с целью устранения языкового разрыва в области ИИ, где главенствуют английский и мандаринский китайский языки.
Как сообщает АЗЕРТАДЖ со ссылкой на американское издание Fortune, генеральный директор Votee AI Пак-Сун Тинг отмечает, что современный бум искусственного интеллекта в основном связан с двумя языками: английским и китайским. Основные разработчики ИИ — OpenAI, Anthropic, DeepSeek, Moonshot AI, Z.ai и другие — почти все расположены в США или на материковом Китае, что позволяет их моделям достигать лучших результатов на родных для них языках. Это оставляет множество других языков и диалектов, даже тех, на которых разговаривают десятки миллионов человек, за кадром.
По словам Пак-Сун Тинга, современные ИИ-модели значительно эффективнее работают с языками, на которых существуют обширные обучающие наборы данных. Таким образом, многие языки и диалекты, несмотря на значительное количество носителей, всё ещё недостаточно представлены в области ИИ.
«Если эти сферы останутся вне учёта, искусственный интеллект окажется фактически бесполезен», — подчеркнул Тинг, акцентируя важность кантонского языка в образовании, здравоохранении и правоохранительных органах.
Votee AI применяет модели с открытыми весами, созданные такими компаниями, как Meta и Alibaba, и проводит дополнительное обучение на данных кантонского диалекта.
Стартап собирает данные из открытых интернет-источников, радиовещания и телепередач, сотрудничая с местными жителями и университетами, а также использует синтетические данные.
Благодаря этому объём данных на кантонском диалекте, используемых компанией, увеличился с 100 миллионов до более чем 500 миллионов токенов. На кантонском диалекте говорит более 80 миллионов людей.
Тем не менее, несмотря на значительное количество носителей, объём стандартизированных письменных данных, особенно отражающих разговорную речь, остаётся достаточно малым. Созданный с участием Votee AI набор тестов HKCanto-Eval демонстрирует, что ведущие ИИ-модели могут справляться с повседневными аспектами кантонского языка, но часто сталкиваются с трудностями, связанными с культурными особенностями и локальным контекстом. Модели Votee AI имеют около 70 миллиардов параметров.
По оценке Тинга, для их обучения используется от 500 миллионов до 1 миллиарда токенов, а стоимость обучения составляет около 250 тысяч долларов, что значительно ниже затрат на разработку крупнейших универсальных ИИ-моделей. В компании уверены, что развитие моделей для кантонского и других недостаточно представленных языков сделает технологии ИИ более доступными для разнообразных языковых сообществ.
