XLM-V:克服多语言掩码语言模型中的词汇瓶颈
计算与语言
2023-10-17 v2 机器学习
摘要
大型多语言语言模型通常依赖在100多种语言间共享的单一词汇表。随着这些模型在参数量与深度上的增长,词汇表大小基本未变。这一\textit{词汇瓶颈}限制了诸如XLM-R等多语言模型的表征能力。本文中,我们提出一种扩展到极大多语言词汇表的新方法:降低词汇重叠较小的语言间词元共享程度,并分配词汇容量以使每种单独语言获得充分覆盖。相较于XLM-R,使用我们词汇表的词元化通常更具语义意义且更短。利用该改进词汇表,我们训练了拥有百万词元词汇表的多语言语言模型XLM-V。XLM-V在我们测试的所有任务上均优于XLM-R,涵盖自然语言推理(XNLI)、问答(MLQA、XQuAD、TyDiQA)及命名实体识别(WikiAnn)。XLM-V在低资源语言任务上尤为有效,在MasakhaNER与Americas NLI上分别绝对超越XLM-R达11.2%与5.8%。
引用
@article{arxiv.2301.10472,
title = {XLM-V: Overcoming the Vocabulary Bottleneck in Multilingual Masked Language Models},
author = {Davis Liang and Hila Gonen and Yuning Mao and Rui Hou and Naman Goyal and Marjan Ghazvininejad and Luke Zettlemoyer and Madian Khabsa},
journal= {arXiv preprint arXiv:2301.10472},
year = {2023}
}
备注
EMNLP 2023