用于评估阅读理解系统的对抗样本
计算与语言
2017-07-25 v1 机器学习
摘要
标准的准确率指标表明阅读理解系统正在快速进步,但这些系统在多大程度上真正理解语言仍不清楚。为了奖励具有真正语言理解能力的系统,我们为斯坦福问答数据集(SQuAD)提出了一种对抗性评估方案。我们的方法测试系统能否回答包含对抗性插入句子的段落问题,这些句子是自动生成的,旨在分散计算机系统的注意力,而不改变正确答案或误导人类。在这种对抗性设置下,十六个已发表模型的准确率从平均 的 F1 分数下降到 ;当允许对手添加不合语法的单词序列时,四个模型的平均准确率进一步下降到 。我们希望我们的见解能激励开发更精确理解语言的新模型。
引用
@article{arxiv.1707.07328,
title = {Adversarial Examples for Evaluating Reading Comprehension Systems},
author = {Robin Jia and Percy Liang},
journal= {arXiv preprint arXiv:1707.07328},
year = {2017}
}
备注
EMNLP 2017