XLDA:用于自然语言推理与问答的跨语言数据增强
计算与语言
2019-05-29 v1 人工智能
机器学习
摘要
虽然自然语言处理系统通常聚焦于单一语言,但多语言迁移学习有潜力提升性能,尤其是对于低资源语言。我们提出 XLDA(跨语言数据增强),一种将输入文本的一段替换为其另一种语言翻译的方法。XLDA 提升了跨语言自然语言推理(XNLI)基准中所有 14 种被测语言的性能。通过 XLDA 训练取得了高达 的提升,在希腊语、土耳其语和乌尔都语上达到了最先进的性能。XLDA 与一种更朴素的、将各语言样本以每种样本仅含单一语言的方式聚合的方法形成对比,且表现明显更优。在 SQuAD 问答任务上,我们看到 XLDA 在英语评测集上带来了 的性能提升。综合实验表明,大多数语言作为跨语言增强器都是有效的,XLDA 对大范围的翻译质量具有鲁棒性,且 XLDA 对随机初始化模型比预训练模型更为有效。
引用
@article{arxiv.1905.11471,
title = {XLDA: Cross-Lingual Data Augmentation for Natural Language Inference and Question Answering},
author = {Jasdeep Singh and Bryan McCann and Nitish Shirish Keskar and Caiming Xiong and Richard Socher},
journal= {arXiv preprint arXiv:1905.11471},
year = {2019}
}