开放域问答数据集中的问答训练-测试重叠现象
计算与语言
2020-08-07 v1 人工智能
摘要
理想情况下,开放域问答模型应具备一系列能力,从简单记忆训练时见过的问题,到用训练时见过的答案回答新表述的问题,再到对具有全新答案的完全新颖问题实现泛化。然而,单一的聚合测试集分数并不能展现模型真实能力的全貌。在这项工作中,我们针对这些能力对三个流行的开放域基准数据集的测试集进行了详细研究。我们发现 60-70% 的测试时答案也出现在训练集中的某处。我们还发现 30% 的测试集问题在相应训练集中存在近似重复的释义。利用这些发现,我们评估了多种流行的开放域模型,以更深入地了解它们实际能泛化的程度以及驱动其整体性能的因素。我们发现,所有模型在无法从训练集中记忆的问题上表现急剧变差,重复数据与非重复数据之间的平均绝对性能差异为 63%。最后我们表明,简单的近邻模型优于 BART 闭卷 QA 模型,进一步凸显了训练集记忆在这些基准中所起的作用。
引用
@article{arxiv.2008.02637,
title = {Question and Answer Test-Train Overlap in Open-Domain Question Answering Datasets},
author = {Patrick Lewis and Pontus Stenetorp and Sebastian Riedel},
journal= {arXiv preprint arXiv:2008.02637},
year = {2020}
}