从自然语言推理数据中的人类集体意见我们能学到什么?
计算与语言
2020-10-12 v2 人工智能
机器学习
摘要
尽管许多 NLP 任务具有主观性,大多数 NLU 评估聚焦于使用 presumed 高一致性的多数标签作为真值。对人类意见分布关注较少。我们收集了 ChaosNLI,一个总计 464,500 条标注的数据集,用于研究常用 NLI 评估集中的集体人类意见(Collective HumAn OpinionS)。该数据集通过为 SNLI 和 MNLI 中的 3,113 个例子以及 Abductive-NLI 中的 1,532 个例子每个收集 100 条标注创建。分析揭示:(1) 这些数据集中显著数量的例子存在高人类分歧;(2) 最先进模型缺乏恢复人类标签上分布的能力;(3) 模型在人类一致性高的数据子集上达到近完美准确率,而在人类一致性低的数据上几乎无法击败随机猜测,后者构成了最先进模型在评估集上所犯常见错误的大部分。这质疑了在评估数据集低一致性部分上改进模型旧指标性能的有效性。因此,我们主张在未来数据收集工作中细致考察人类一致性,并针对集体人类意见上的分布评估模型输出。ChaosNLI 数据集与实验脚本可在 https://github.com/easonnie/ChaosNLI 获取。
引用
@article{arxiv.2010.03532,
title = {What Can We Learn from Collective Human Opinions on Natural Language Inference Data?},
author = {Yixin Nie and Xiang Zhou and Mohit Bansal},
journal= {arXiv preprint arXiv:2010.03532},
year = {2020}
}
备注
EMNLP 2020 (13 pages)