中文

IndoNLI:面向印尼语的自然语言推理数据集

计算与语言 2022-03-30 v1

摘要

我们提出 IndoNLI,首个由人工标注的印尼语自然语言推理(NLI)数据集。我们改编 MNLI 的数据收集协议,收集了近 18K 个由众包工人和专家标注的句子对。专家标注数据仅用作测试集。该测试集通过显式纳入数值推理、结构变化、习语或时空推理等多种语言现象,旨在为印尼语 NLI 提供具有挑战性的测试平台。实验结果表明,XLM-R 在我们的数据中优于其他预训练模型。在专家标注数据上的最佳性能仍远低于人类水平(13.4% 准确率差距),表明该测试集尤其具有挑战性。此外,我们的分析显示,专家标注数据更具多样性,且比众包标注数据含有更少的标注伪迹。我们希望该数据集能助力印尼语 NLP 研究取得进展。

关键词

引用

@article{arxiv.2110.14566,
  title  = {IndoNLI: A Natural Language Inference Dataset for Indonesian},
  author = {Rahmad Mahendra and Alham Fikri Aji and Samuel Louvan and Fahrurrozi Rahman and Clara Vania},
  journal= {arXiv preprint arXiv:2110.14566},
  year   = {2022}
}

备注

Accepted at EMNLP 2021 main conference