模型从问答数据集中学到了什么?
计算与语言
2021-09-14 v2
摘要
尽管模型在 SQuAD 等流行问答(QA)数据集上已达到超越人类的表现,它们尚未在问答任务本身上超越人类。本文通过跨五个数据集评估基于 BERT 的模型,探究模型是否从 QA 数据集中学习阅读理解。我们评估了模型对域外样本的泛化能力、对缺失或错误数据的响应以及处理问题变体的能力。我们发现没有任何单一数据集对我们的所有实验都鲁棒,并指出了数据集与评估方法的不足。基于我们的分析,我们为构建未来更好地通过阅读理解评估问答任务的 QA 数据集提出建议。我们还在 https://github.com/amazon-research/qa-dataset-converter 发布了将 QA 数据集转换为共享格式以便更易实验的代码。
引用
@article{arxiv.2004.03490,
title = {What do Models Learn from Question Answering Datasets?},
author = {Priyanka Sen and Amir Saffari},
journal= {arXiv preprint arXiv:2004.03490},
year = {2021}
}
备注
Accepted at EMNLP 2020