中文

什么驱动了多语言语言模型的性能?

计算与语言 2024-12-10 v1

摘要

本研究调查影响多语言大语言模型(MLLMs)在不同语言上表现的因素。我们研究了6种 MLLMs,包括掩码语言模型、自回归模型和指令调优 LLM,针对包含204种语言的 SIB-200 数据集上的主题分类任务。我们的分析考虑三种情景:ALL 语言、SEEN 语言(存在于模型预训练数据中)和 UNSEEN 语言(在模型预训练数据中以任何有意义的方式不存在或未记录)。我们检查了诸如预训练数据大小、一般资源可用性、语言家族和脚本类型对模型性能的影响。决策树分析表明,预训练数据大小是 SEEN 语言最重要的因素。然而,值得注意的是,脚本类型和语言家族对 UNSEEN 语言至关重要,这突显了跨语言迁移学习的重要性。值得注意的是,模型大小和体系结构并不显著影响确定的最重要特征。我们的发现为理解当前 MLLM 的优势和局限性提供了有价值的见解,并希望指导开发更有效和更公平的多语言 NLP 系统。

关键词

引用

@article{arxiv.2404.19159,
  title  = {What Drives Performance in Multilingual Language Models?},
  author = {Sina Bagheri Nezhad and Ameeta Agrawal},
  journal= {arXiv preprint arXiv:2404.19159},
  year   = {2024}
}

备注

Accepted at VarDial @ NAACL 2024