利用对抗距离发现高置信度错误
机器学习
2020-06-30 v1 机器学习
摘要
给定一个我们视为黑盒的深度神经网络图像分类模型,以及一个无标签评估数据集,我们开发了一种高效策略来对该分类器进行评估。从无标签评估数据集中随机采样并标注样本,可以估计准确率、精确率和召回率等传统性能指标。然而,随机采样可能会遗漏模型对其预测高度置信但却错误的罕见错误。这些高置信度错误可能代表代价高昂的失误,因此应被显式搜索。以往工作开发了搜索技术来寻找高于指定置信阈值的分类错误,但忽略了错误应预期出现在低于 100% 的任何置信水平上的事实。在本工作中,我们研究以高于给定模型置信度下预期速率发现错误的问题。此外,我们提出一种查询高效且新颖的搜索技术,其由对抗扰动引导,以在黑盒模型中发现这些错误。通过严格的实证实验,我们证明我们的对抗距离(Adversarial Distance)搜索以高于给定模型置信度下预期的速率发现了高置信度错误。
引用
@article{arxiv.2006.16055,
title = {Harnessing Adversarial Distances to Discover High-Confidence Errors},
author = {Walter Bennette and Karsten Maurer and Sean Sisti},
journal= {arXiv preprint arXiv:2006.16055},
year = {2020}
}
备注
10 pages, 9 figures