超越准确率:使用 CheckList 对 NLP 模型进行行为测试
计算与语言
2020-05-11 v1 机器学习
摘要
尽管测量留出准确率一直是评估泛化能力的主要方法,但它往往高估了 NLP 模型的性能,而评估模型的其他方法要么侧重于单个任务,要么侧重于特定行为。受软件工程中行为测试原则的启发,我们引入了 CheckList,一种用于测试 NLP 模型的任务无关方法。CheckList 包含一个由通用语言能力和测试类型组成的矩阵,以促进全面的测试构思,并提供了一个软件工具来快速生成大量且多样化的测试用例。我们通过三个任务的测试说明了 CheckList 的效用,在商业模型和 SOTA 模型中都发现了关键故障。在一项用户研究中,负责一个商业情感分析模型的团队在一个经过广泛测试的模型中发现了新的且可操作的缺陷。在另一项用户研究中,使用 CheckList 的 NLP 从业者创建的测试数量是不使用它的用户的两倍,发现的缺陷数量几乎是后者的三倍。
引用
@article{arxiv.2005.04118,
title = {Beyond Accuracy: Behavioral Testing of NLP models with CheckList},
author = {Marco Tulio Ribeiro and Tongshuang Wu and Carlos Guestrin and Sameer Singh},
journal= {arXiv preprint arXiv:2005.04118},
year = {2020}
}