阅读理解需要多少阅读?对流行基准的批判性考察
计算与语言
2018-08-22 v2 人工智能
机器学习
机器学习
摘要
许多近期论文关注阅读理解,其样本由 (问题, 段落, 答案) 三元组构成。据推测,模型必须结合问题与段落中的信息来预测相应答案。然而,尽管该话题备受关注,数百篇已发表论文争夺排行榜主导地位,关于许多流行基准难度的基本问题仍悬而未决。本文为 bAbI、SQuAD、CBT、CNN 和 Who-did-What 数据集建立了合理的基线,发现仅用问题或仅用段落的模型往往表现得出奇地好。在 个 bAbI 任务中的 个上,仅用段落的模型达到了大于 的准确率,有时与完整模型相当。有趣的是,尽管 CBT 提供 句故事,仅最后一句就足以作出准确度相近的预测。相比之下,SQuAD 和 CNN 看似构建得更好。
引用
@article{arxiv.1808.04926,
title = {How Much Reading Does Reading Comprehension Require? A Critical Investigation of Popular Benchmarks},
author = {Divyansh Kaushik and Zachary C. Lipton},
journal= {arXiv preprint arXiv:1808.04926},
year = {2018}
}
备注
To appear in EMNLP 2018