中文

跨语言迁移学习中的翻译伪迹

计算与语言 2021-12-28 v4 机器学习

摘要

人工与机器翻译在跨语言迁移学习中均扮演核心角色:许多多语言数据集通过专业翻译服务创建,且使用机器翻译翻译测试集或训练集是一种广泛使用的迁移技术。在本文中,我们表明此类翻译过程会引入细微的伪迹,对现有跨语言模型产生显著影响。例如,在自然语言推理中,独立翻译前提与假设会减少二者间的词汇重叠,而当前模型对此高度敏感。我们表明,跨语言迁移学习中的一些先前发现需要依据该现象重新考量。基于所获见解,我们还将 XNLI 中 translate-test 与 zero-shot 方法的现有最优水平分别提升了 4.3 和 2.8 个点。

关键词

引用

@article{arxiv.2004.04721,
  title  = {Translation Artifacts in Cross-lingual Transfer Learning},
  author = {Mikel Artetxe and Gorka Labaka and Eneko Agirre},
  journal= {arXiv preprint arXiv:2004.04721},
  year   = {2021}
}

备注

EMNLP 2020