阿塞拿疆语言的开放基础模型
计算与语言
2024-08-21 v2
摘要
多语言大语言模型的出现使阿塞拿疆语言的理解与生成系统得以发展。然而,大多数生产级系统依赖云端解决方案,如 GPT-4。尽管已有数个尝试开发阿塞拿疆语言的开放基础模型,但由于缺乏系统性基准测试,这些作品未能获得广泛使用。本文涵盖了多个推动阿塞拿疆语言开放源码基础模型发展的工作。我们提出 (1) 一个阿塞拿疆大文本语料库,(2) 一系列在此数据集上训练的编码器-only 语言模型,(3) 用于评估这些模型的标记数据集,以及 (4) 覆盖所有主要开源模型的广泛评估,这些模型支持阿塞拿疆语言。
引用
@article{arxiv.2407.02337,
title = {Open foundation models for Azerbaijani language},
author = {Jafar Isbarov and Kavsar Huseynova and Elvin Mammadov and Mammad Hajili and Duygu Ataman},
journal= {arXiv preprint arXiv:2407.02337},
year = {2024}
}
备注
Presented in the First Workshop on Natural Language Processing for Turkic Languages