中文

阅读理解模型在非对抗样本上令人沮丧的糟糕表现

计算与语言 2019-04-05 v1

摘要

当人类学习执行一项困难任务(例如,在较长段落上的阅读理解(RC))时,通常其在该任务较易版本(例如,在较短段落上的 RC)上的表现会显著提升。理想情况下,我们希望智能体也能展现出此类行为。然而,在使用标准 RACE 数据集对最先进的 RC 模型进行实验时,我们观察到事实并非如此。具体而言,我们看到了反直觉的结果:即便在测试时向模型展示极其简单的示例,其表现也几乎没有改善。我们称之为非对抗评估,以区别于对抗评估。此类非对抗样本使我们能够评估专用神经组件的效用。例如,我们表明,即使在答案明确嵌入段落中的简单示例上,为关注段落相关部分而设计的神经组件也未能实现其预期目的。我们认为,作为本工作一部分所创建的非对抗数据集将补充关于对抗评估的研究,并对 RC 模型的能力给出更现实的评估。本工作开发的所有数据集与代码将公开可用。

关键词

引用

@article{arxiv.1904.02665,
  title  = {Frustratingly Poor Performance of Reading Comprehension Models on Non-adversarial Examples},
  author = {Soham Parikh and Ananya B. Sai and Preksha Nema and Mitesh M. Khapra},
  journal= {arXiv preprint arXiv:1904.02665},
  year   = {2019}
}

备注

8 pages