中文

用于评估阅读理解系统的对抗样本

计算与语言 2017-07-25 v1 机器学习

摘要

标准的准确率指标表明阅读理解系统正在快速进步,但这些系统在多大程度上真正理解语言仍不清楚。为了奖励具有真正语言理解能力的系统,我们为斯坦福问答数据集(SQuAD)提出了一种对抗性评估方案。我们的方法测试系统能否回答包含对抗性插入句子的段落问题,这些句子是自动生成的,旨在分散计算机系统的注意力,而不改变正确答案或误导人类。在这种对抗性设置下,十六个已发表模型的准确率从平均 75%75\% 的 F1 分数下降到 36%36\%;当允许对手添加不合语法的单词序列时,四个模型的平均准确率进一步下降到 7%7\%。我们希望我们的见解能激励开发更精确理解语言的新模型。

关键词

引用

@article{arxiv.1707.07328,
  title  = {Adversarial Examples for Evaluating Reading Comprehension Systems},
  author = {Robin Jia and Percy Liang},
  journal= {arXiv preprint arXiv:1707.07328},
  year   = {2017}
}

备注

EMNLP 2017