中文

ProtoQA:面向原型常识推理的问答数据集

计算与语言 2020-10-29 v3

摘要

给定关于某些原型情境的问题,例如“说出人们离家上班前通常会做的事?”,人类可凭借已有经验轻松回答。此类问题可有多个正确答案,其中某些对一情境而言较其他更常见。本文介绍一个新的问答数据集,用于在此类原型情境中训练和评估人工智能系统的常识推理能力。训练集采集自长期国际游戏节目 FAMILY-FEUD 中已有的问题集合。隐藏评估集通过从 100 名众包工人处收集每题答案构建。我们还提出一种生成式评估任务,要求模型输出排序答案列表,理想情况下覆盖某问题的所有原型答案。在给出多个有竞争力的基线模型后,我们发现人类表现在所有评估指标上仍以显著差距超过模型分数,印证了该任务的挑战性。

关键词

引用

@article{arxiv.2005.00771,
  title  = {ProtoQA: A Question Answering Dataset for Prototypical Common-Sense Reasoning},
  author = {Michael Boratko and Xiang Lorraine Li and Rajarshi Das and Tim O'Gorman and Dan Le and Andrew McCallum},
  journal= {arXiv preprint arXiv:2005.00771},
  year   = {2020}
}

备注

First four authors contribute equally