中文

CODAH:一个针对常识的对抗式生成问答数据集

计算与语言 2019-07-29 v4 机器学习

摘要

常识推理是一项关键的人工智能能力,但构建测试常识的具有挑战性的数据集十分困难。近期基于大型预训练语言模型的神经问答系统,已经在常识知识基准上取得了接近人类水平的性能。这些系统并不具备人类水平的常识,但能够利用数据集的局限性来达到人类水平的分数。我们引入了CODAH数据集,一个用于测试常识的对抗式构建的评估数据集。CODAH构成了近期提出的SWAG数据集的一个具有挑战性的扩展,SWAG使用描述视频中观察到情景的句子补全问题来测试常识知识。为了产生更困难的数据集,我们引入了一种新颖的问题获取流程,其中众包工作者撰写旨在针对最先进神经问答系统弱点的题目。工作者提交的、在微调前和交叉验证中微调后模型均无法正确回答的题目会获得奖励。我们通过该流程创建了2.8k个问题,并在我们的数据集上评估了多个最先进问答系统的性能。我们观察到人类性能为95.3%,而BERT-Large模型的最佳基线准确率为67.5%,两者之间存在显著差距。

关键词

引用

@article{arxiv.1904.04365,
  title  = {CODAH: An Adversarially Authored Question-Answer Dataset for Common Sense},
  author = {Michael Chen and Mike D'Arcy and Alisa Liu and Jared Fernandez and Doug Downey},
  journal= {arXiv preprint arXiv:1904.04365},
  year   = {2019}
}

备注

8 pages, Appeared in RepEval 2019