中文

XLDA:用于自然语言推理与问答的跨语言数据增强

计算与语言 2019-05-29 v1 人工智能 机器学习

摘要

虽然自然语言处理系统通常聚焦于单一语言,但多语言迁移学习有潜力提升性能,尤其是对于低资源语言。我们提出 XLDA(跨语言数据增强),一种将输入文本的一段替换为其另一种语言翻译的方法。XLDA 提升了跨语言自然语言推理(XNLI)基准中所有 14 种被测语言的性能。通过 XLDA 训练取得了高达 4.8%4.8\% 的提升,在希腊语、土耳其语和乌尔都语上达到了最先进的性能。XLDA 与一种更朴素的、将各语言样本以每种样本仅含单一语言的方式聚合的方法形成对比,且表现明显更优。在 SQuAD 问答任务上,我们看到 XLDA 在英语评测集上带来了 1.0%1.0\% 的性能提升。综合实验表明,大多数语言作为跨语言增强器都是有效的,XLDA 对大范围的翻译质量具有鲁棒性,且 XLDA 对随机初始化模型比预训练模型更为有效。

关键词

引用

@article{arxiv.1905.11471,
  title  = {XLDA: Cross-Lingual Data Augmentation for Natural Language Inference and Question Answering},
  author = {Jasdeep Singh and Bryan McCann and Nitish Shirish Keskar and Caiming Xiong and Richard Socher},
  journal= {arXiv preprint arXiv:1905.11471},
  year   = {2019}
}