我们对多项选择问答系统的期望是什么?
计算与语言
2020-11-24 v1 人工智能
摘要
机器学习系统在各种 QA 数据集上的近期成功可被解读为模型语言理解能力的显著提升。然而,使用各种扰动,多项近期工作表明,在数据集上的良好表现可能并不表示与人们对“理解”语言的模型的期望相符的性能。在本工作中,我们考虑一个在多个多项选择问答(MCQA)数据集上表现顶尖的模型,并使用一系列对模型输入的零信息扰动,针对人们对此类模型可能抱有的期望集合对其进行评估。我们的结果表明,该模型明显未达到我们的期望,并促使了一种改进的的训练方法,迫使模型更好地关注输入。我们展示了这一新训练范式产生了一个性能与原模型相当同时更好地满足我们期望的模型。
引用
@article{arxiv.2011.10647,
title = {What do we expect from Multiple-choice QA Systems?},
author = {Krunal Shah and Nitish Gupta and Dan Roth},
journal= {arXiv preprint arXiv:2011.10647},
year = {2020}
}
备注
Findings of EMNLP 2020