中文

OCNLI:原生中文自然语言推理数据集

计算与语言 2020-10-13 v1

摘要

尽管自然语言推理(NLI)近期取得了巨大进展,且很大程度上由对新数据集(如SNLI、MNLI)的大规模投入和建模方面的进步所推动,但由于世界上大多数语言缺乏可靠数据集,多数进展仍局限于英语。本文提出了首个大规模中文NLI数据集(包含约56,000个标注句对),称为原生中文自然语言推理数据集(OCNLI)。与近期将NLI扩展至其他语言的尝试不同,我们的数据集不依赖任何自动翻译或非专家标注,而是由专攻语言学的母语者进行标注。我们紧密遵循MNLI所用的标注协议,但创建了引发多样化假设的新策略。我们使用最先进的中文预训练模型在我们的数据集上建立了若干基线结果,发现即便性能最佳的模型也远远落后于人类表现(约12%的绝对性能差距),这使其成为一个具有挑战性的新资源,我们希望它能助力加速中文自然语言理解(NLU)的进展。据我们所知,这是首个为非英语语言由人类引出的MNLI风格语料库。

关键词

引用

@article{arxiv.2010.05444,
  title  = {OCNLI: Original Chinese Natural Language Inference},
  author = {Hai Hu and Kyle Richardson and Liang Xu and Lu Li and Sandra Kuebler and Lawrence S. Moss},
  journal= {arXiv preprint arXiv:2010.05444},
  year   = {2020}
}

备注

Findings of EMNLP 2020