“我们部门”:机器翻译语料如何影响机器阅读理解任务中的语言模型
计算与语言
2020-07-07 v1
摘要
预训练大规模语言模型(LM)需要海量文本语料。英语语言模型享有不断增长且多样化的语言资源语料。然而,资源较少的语言及其单语与多语语言模型往往难以获取更大的数据集。此类情况下的典型做法是将英语语料机器翻译为目标语言。本工作中,我们研究了直接应用翻译语料微调语言模型以用于下游自然语言处理任务的隐患,并表明细致的整理与后处理可提升性能及语言模型整体的鲁棒性。在实证评估中,我们在用户与系统层面对直接翻译与经整理的西班牙语SQuAD数据集进行了比较。在XQuAD与MLQA迁移学习评估问答任务上的进一步实验结果表明,据称多语的语言模型在精确匹配分数方面对机器翻译伪影表现出更强的韧性。
引用
@article{arxiv.2007.01955,
title = {El Departamento de Nosotros: How Machine Translated Corpora Affects Language Models in MRC Tasks},
author = {Maria Khvalchik and Mikhail Galkin},
journal= {arXiv preprint arXiv:2007.01955},
year = {2020}
}