迈向更具包容性的 AI:Sámi 语大型语言模型训练的进展与展望
计算与语言
2024-05-10 v1 人工智能
摘要
Sámi 语是一个包含多种语言的土著语群,由于缺乏数据以及针对其语言复杂性设计的复杂语言模型,面临着数字边缘化。这项工作侧重于提高 Sámi 语的技术参与度。我们将 ML 社区的注意力引向超低资源语言的语言建模问题。ULR 语言是指可用文本资源非常少且使用人数也非常少的语言。ULRLs 也不受 ChatGPT 等主流大型语言模型的支持,这使得为它们收集人工训练数据变得更加困难。主流 AI 基础模型开发对这类语言的关注较少。通常,这些语言的使用者很少,使得它们很难被发现。然而,为这些 ULR 语言开发基础模型对于促进包容性以及 LLM 的实际能力和影响非常重要。为此,我们从网络上收集了可用的 Sámi 语资源,以创建用于训练语言模型的干净数据集。为了研究现代 LLM 模型在 ULR 语言(Sámi 语)上的行为,我们用不同类型的 LLM 进行了实验,主要在约七十亿参数量级。我们还探讨了 ULRLs 多语言 LLM 训练的效果。我们发现,在顺序多语言训练场景下,decoder-only 模型的表现优于联合多语言训练,而具有高语义重叠的多语言训练总体上优于从头开始训练。这是针对 Sámi 语适配使用自然语言处理(NLP)领域最新发展的非统计语言模型的首项研究。
引用
@article{arxiv.2405.05777,
title = {Towards a More Inclusive AI: Progress and Perspectives in Large Language Model Training for the S\'ami Language},
author = {Ronny Paul and Himanshu Buckchash and Shantipriya Parida and Dilip K. Prasad},
journal= {arXiv preprint arXiv:2405.05777},
year = {2024}
}