中文

阅读理解需要多少阅读?对流行基准的批判性考察

计算与语言 2018-08-22 v2 人工智能 机器学习 机器学习

摘要

许多近期论文关注阅读理解,其样本由 (问题, 段落, 答案) 三元组构成。据推测,模型必须结合问题与段落中的信息来预测相应答案。然而,尽管该话题备受关注,数百篇已发表论文争夺排行榜主导地位,关于许多流行基准难度的基本问题仍悬而未决。本文为 bAbI、SQuAD、CBT、CNN 和 Who-did-What 数据集建立了合理的基线,发现仅用问题或仅用段落的模型往往表现得出奇地好。在 2020 个 bAbI 任务中的 1414 个上,仅用段落的模型达到了大于 50%50\% 的准确率,有时与完整模型相当。有趣的是,尽管 CBT 提供 2020 句故事,仅最后一句就足以作出准确度相近的预测。相比之下,SQuAD 和 CNN 看似构建得更好。

关键词

引用

@article{arxiv.1808.04926,
  title  = {How Much Reading Does Reading Comprehension Require? A Critical Investigation of Popular Benchmarks},
  author = {Divyansh Kaushik and Zachary C. Lipton},
  journal= {arXiv preprint arXiv:1808.04926},
  year   = {2018}
}

备注

To appear in EMNLP 2018