通过对比集评估模型的局部决策边界
计算与语言
2020-10-05 v2
摘要
监督学习的标准测试集用于评估分布内泛化能力。然而,当数据集存在系统性缺陷(如标注伪影)时,这些评估结果具有误导性:模型可以学习到简单的决策规则,在测试集上表现良好,但并未掌握数据集所预期的能力。我们提出了一种新的 NLP 标注范式,有助于填补测试数据中的系统性缺陷。具体而言,在数据集构建完成后,我们建议数据集作者以微小但有意义的方式手动扰动测试实例,这些扰动(通常)会改变标准标签,从而构建对比集。对比集提供了对模型决策边界的局部视角,可用于更准确地评估模型真实的语言能力。我们通过为 10 个不同的 NLP 数据集(如 DROP 阅读理解、UD 解析、IMDb 情感分析)构建对比集,展示了对比集的有效性。尽管我们的对比集并非显式对抗性的,但模型在对比集上的表现显著低于在原始测试集上的表现——在某些情况下下降达 25%。我们发布了这些对比集作为新的评估基准,并鼓励未来的数据集构建工作采用类似的标注流程。
引用
@article{arxiv.2004.02709,
title = {Evaluating Models' Local Decision Boundaries via Contrast Sets},
author = {Matt Gardner and Yoav Artzi and Victoria Basmova and Jonathan Berant and Ben Bogin and Sihao Chen and Pradeep Dasigi and Dheeru Dua and Yanai Elazar and Ananth Gottumukkala and Nitish Gupta and Hanna Hajishirzi and Gabriel Ilharco and Daniel Khashabi and Kevin Lin and Jiangming Liu and Nelson F. Liu and Phoebe Mulcaire and Qiang Ning and Sameer Singh and Noah A. Smith and Sanjay Subramanian and Reut Tsarfaty and Eric Wallace and Ally Zhang and Ben Zhou},
journal= {arXiv preprint arXiv:2004.02709},
year = {2020}
}