中文

CRoW:真实世界任务中的常识推理基准

计算与语言 2023-10-25 v1 人工智能

摘要

自然语言处理 (NLP) 常识推理研究近期的努力已产生大量新数据集与基准。然而,这些数据集多数在人工场景中表述常识推理挑战,不能反映真实世界 NLP 系统所设计解决的任务。在本工作中,我们提出 CRoW,一个人工筛选的多任务基准,评估模型在六种真实世界 NLP 任务语境中应用常识推理的能力。CRoW 使用多阶段数据收集流程构建,该流程利用违背常识的扰动重写现有数据集中的样例。我们使用 CRoW 研究 NLP 系统如何跨越常识知识的不同维度(如物理、时间与社会推理)表现。我们发现当 NLP 系统在 CRoW 上受评时相较人类存在显著性能差距,表明在真实世界任务设定中常识推理远未解决。我们将数据集与排行榜在 https://github.com/mismayil/crow 提供给研究界。

关键词

引用

@article{arxiv.2310.15239,
  title  = {CRoW: Benchmarking Commonsense Reasoning in Real-World Tasks},
  author = {Mete Ismayilzada and Debjit Paul and Syrielle Montariol and Mor Geva and Antoine Bosselut},
  journal= {arXiv preprint arXiv:2310.15239},
  year   = {2023}
}

备注

37 pages, camera-ready for EMNLP 2023