中文

不置可否:自然语言推理中中立性的重新操作化定义

计算与语言 2023-06-19 v1 人工智能

摘要

自然语言推理(NLI)一直是评估语言模型推理能力的基石任务。然而,NLI中使用的标准三分类方案在评估模型捕捉自然人类推理细微差别的能力方面存在众所周知的缺陷。在本文中,我们认为当前NLI数据集中中立标签的操作化定义效度较低、解释不一致,且至少一种重要的中立含义常被忽略。我们揭示了这些缺陷的有害影响,在某些情况下会导致标注数据集反而降低下游任务的性能。我们比较了处理标注者分歧的方法,并指出了近期一个基于有问题的操作化定义设计标注者研究的NLI数据集中的缺陷。我们的发现凸显了对NLI更精细评估框架的需求,并希望引发NLP社区的进一步讨论与行动。

关键词

引用

@article{arxiv.2306.09918,
  title  = {No Strong Feelings One Way or Another: Re-operationalizing Neutrality in Natural Language Inference},
  author = {Animesh Nighojkar and Antonio Laverghetta and John Licato},
  journal= {arXiv preprint arXiv:2306.09918},
  year   = {2023}
}

备注

Appearing at the 17th Linguistic Annotation Workshop at ACL 2023