中文

利用对抗距离发现高置信度错误

机器学习 2020-06-30 v1 机器学习

摘要

给定一个我们视为黑盒的深度神经网络图像分类模型,以及一个无标签评估数据集,我们开发了一种高效策略来对该分类器进行评估。从无标签评估数据集中随机采样并标注样本,可以估计准确率、精确率和召回率等传统性能指标。然而,随机采样可能会遗漏模型对其预测高度置信但却错误的罕见错误。这些高置信度错误可能代表代价高昂的失误,因此应被显式搜索。以往工作开发了搜索技术来寻找高于指定置信阈值的分类错误,但忽略了错误应预期出现在低于 100% 的任何置信水平上的事实。在本工作中,我们研究以高于给定模型置信度下预期速率发现错误的问题。此外,我们提出一种查询高效且新颖的搜索技术,其由对抗扰动引导,以在黑盒模型中发现这些错误。通过严格的实证实验,我们证明我们的对抗距离(Adversarial Distance)搜索以高于给定模型置信度下预期的速率发现了高置信度错误。

关键词

引用

@article{arxiv.2006.16055,
  title  = {Harnessing Adversarial Distances to Discover High-Confidence Errors},
  author = {Walter Bennette and Karsten Maurer and Sean Sisti},
  journal= {arXiv preprint arXiv:2006.16055},
  year   = {2020}
}

备注

10 pages, 9 figures