中文

XCOPA:一个用于因果常识推理的多语言数据集

计算与语言 2020-10-28 v2

摘要

为模拟人类语言能力,自然语言处理系统必须能够对日常情境的动态进行推理,包括其可能的原因与结果。此外,它们应能将所获得的世界知识推广到新的语言,并考虑文化差异。机器推理与跨语言迁移的进展依赖于具有挑战性的评测基准的可用性。受这两方面需求的推动,我们引入了跨语言合理备选项选择(XCOPA),一个涵盖 11 种语言、具有类型学多样性的用于因果常识推理的多语言数据集,其中包括东部阿普里马克克丘亚语和海地克里奥尔语等资源匮乏语言。我们在此新数据集上评估了一系列最先进模型,揭示出当前基于多语言预训练与零样本微调的方法性能不及基于翻译的迁移。最后,我们提出了将多语言模型适配到仅有小型语料库或双语词典可用的分布外资源稀缺语言的策略,并报告了相较随机基线的大幅改进。XCOPA 数据集可在 github.com/cambridgeltl/xcopa 免费获取。

关键词

引用

@article{arxiv.2005.00333,
  title  = {XCOPA: A Multilingual Dataset for Causal Commonsense Reasoning},
  author = {Edoardo Maria Ponti and Goran Glavaš and Olga Majewska and Qianchu Liu and Ivan Vulić and Anna Korhonen},
  journal= {arXiv preprint arXiv:2005.00333},
  year   = {2020}
}