中文

语言污染有助于解释英语预训练模型的跨语言能力

计算与语言 2022-11-18 v4

摘要

英语预训练语言模型构成众多现代 NLP 系统的骨干,需要海量无标注训练数据。这些模型通常被认为仅在英语文本上训练,却被发现能出奇地良好迁移至其他语言。我们探究此现象,发现常见的英语预训练语料实际包含显著量的非英语文本:即便非英语数据占比不足 1%(远在强语言分类器错误率之内),在大规模数据集中也对应数亿外语词元。我们进而证明,即便如此少量的非英语数据也能促进在其上训练的模型的跨语言迁移,目标语言性能与预训练期间所见母语数据量强相关。鉴于这些发现,我们认为大规模预训练下没有模型是真正的单语模型,在评估跨语言迁移时应考虑这一点。

关键词

引用

@article{arxiv.2204.08110,
  title  = {Language Contamination Helps Explain the Cross-lingual Capabilities of English Pretrained Models},
  author = {Terra Blevins and Luke Zettlemoyer},
  journal= {arXiv preprint arXiv:2204.08110},
  year   = {2022}
}

备注

EMNLP 2022; corrected typos in appendix tables