中文

XLM-V:克服多语言掩码语言模型中的词汇瓶颈

计算与语言 2023-10-17 v2 机器学习

摘要

大型多语言语言模型通常依赖在100多种语言间共享的单一词汇表。随着这些模型在参数量与深度上的增长,词汇表大小基本未变。这一\textit{词汇瓶颈}限制了诸如XLM-R等多语言模型的表征能力。本文中,我们提出一种扩展到极大多语言词汇表的新方法:降低词汇重叠较小的语言间词元共享程度,并分配词汇容量以使每种单独语言获得充分覆盖。相较于XLM-R,使用我们词汇表的词元化通常更具语义意义且更短。利用该改进词汇表,我们训练了拥有百万词元词汇表的多语言语言模型XLM-V。XLM-V在我们测试的所有任务上均优于XLM-R,涵盖自然语言推理(XNLI)、问答(MLQA、XQuAD、TyDiQA)及命名实体识别(WikiAnn)。XLM-V在低资源语言任务上尤为有效,在MasakhaNER与Americas NLI上分别绝对超越XLM-R达11.2%与5.8%。

关键词

引用

@article{arxiv.2301.10472,
  title  = {XLM-V: Overcoming the Vocabulary Bottleneck in Multilingual Masked Language Models},
  author = {Davis Liang and Hila Gonen and Yuning Mao and Rui Hou and Naman Goyal and Marjan Ghazvininejad and Luke Zettlemoyer and Madian Khabsa},
  journal= {arXiv preprint arXiv:2301.10472},
  year   = {2023}
}

备注

EMNLP 2023