中文

模型从问答数据集中学到了什么?

计算与语言 2021-09-14 v2

摘要

尽管模型在 SQuAD 等流行问答(QA)数据集上已达到超越人类的表现,它们尚未在问答任务本身上超越人类。本文通过跨五个数据集评估基于 BERT 的模型,探究模型是否从 QA 数据集中学习阅读理解。我们评估了模型对域外样本的泛化能力、对缺失或错误数据的响应以及处理问题变体的能力。我们发现没有任何单一数据集对我们的所有实验都鲁棒,并指出了数据集与评估方法的不足。基于我们的分析,我们为构建未来更好地通过阅读理解评估问答任务的 QA 数据集提出建议。我们还在 https://github.com/amazon-research/qa-dataset-converter 发布了将 QA 数据集转换为共享格式以便更易实验的代码。

关键词

引用

@article{arxiv.2004.03490,
  title  = {What do Models Learn from Question Answering Datasets?},
  author = {Priyanka Sen and Amir Saffari},
  journal= {arXiv preprint arXiv:2004.03490},
  year   = {2021}
}

备注

Accepted at EMNLP 2020