你的分词器有多好?论多语言语言模型的单语表现
计算与语言
2021-06-03 v2
摘要
本文中,我们针对预训练多语言语言模型与其单语对应模型在单语任务表现上,提供系统且全面的实证比较。我们研究九种类型学上多样且具备现成预训练单语模型的语言,在五个多样的下游单语任务上展开评测。我们首先旨在通过公平且受控的比较,确立该语言的多语言与对应单语表征之间是否存在差距,随后探究任何性能差异的原因。为解耦混淆因素,我们在相同数据上以单语与多语训练的分词器训练新的单语模型。我们发现,虽然预训练数据规模是重要因素,但专用的单语分词器在下游表现中起着同等重要的作用。我们的结果表明,在多语言模型词表中得到充分表示的语言,相较其单语对应模型表现出可忽略的性能下降。我们进一步发现,将原始多语言分词器替换为专用单语分词器,几乎对每个任务和语言都提升了多语言模型的下游表现。
引用
@article{arxiv.2012.15613,
title = {How Good is Your Tokenizer? On the Monolingual Performance of Multilingual Language Models},
author = {Phillip Rust and Jonas Pfeiffer and Ivan Vulić and Sebastian Ruder and Iryna Gurevych},
journal= {arXiv preprint arXiv:2012.15613},
year = {2021}
}
备注
ACL 2021