中文

Glot500:将多语言语料库与语言模型扩展到 500 种语言

计算与语言 2023-08-31 v2

摘要

NLP 社区主要聚焦于纵向扩展大语言模型(LLMs),即让它们对约 100 种语言表现更好。我们转而横向扩展 LLMs:我们通过持续预训练创建了 Glot500-m,一个覆盖 511 种以低资源语言为主的语言的 LLM。这一工作的重要部分是收集并清洗 Glot500-c,一个覆盖这 511 种语言并使我们能够训练 Glot500-m 的语料库。我们在这些语言上的五项不同任务上评估 Glot500-m。我们观察到,与 XLM-R 基线相比,高资源与低资源语言均有大幅改进。我们的分析表明,没有单一因素能解释多语言 LLM 表示的质量。相反,包括语料库规模、文字系统、来自相关语言的“帮助”以及模型总容量在内的因素组合决定了质量。我们的工作解决了 NLP 研究的一个重要目标:我们不应将 NLP 局限于世界上一小部分语言,而应努力支持尽可能多的语言,以将 NLP 技术的益处带给所有语言与文化。代码、数据与模型可在 https://github.com/cisnlp/Glot500 获取。

关键词

引用

@article{arxiv.2305.12182,
  title  = {Glot500: Scaling Multilingual Corpora and Language Models to 500 Languages},
  author = {Ayyoob Imani and Peiqin Lin and Amir Hossein Kargaran and Silvia Severini and Masoud Jalili Sabet and Nora Kassner and Chunlan Ma and Helmut Schmid and André F. T. Martins and François Yvon and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2305.12182},
  year   = {2023}
}

备注

ACL 2023