中文

模型错在哪里?面向可解释性的参数空间显著性图

计算机视觉与模式识别 2022-10-11 v2 机器学习

摘要

传统的显著性图突出显示神经网络预测高度敏感的输入特征。我们采用不同的显著性方法,识别并分析导致错误决策的网络参数,而非输入。我们发现,导致类似参数故障的样本在语义上相似。我们还表明,修剪错误分类样本中最显著的参数通常会改善模型行为。此外,在单个样本上微调少量最显著的参数可以纠正因类似原因而错误分类的其他样本。基于我们的参数显著性方法,我们还引入了一种输入空间显著性技术,揭示图像特征如何导致特定网络组件故障。进一步,我们在数据集和案例研究层面严格验证了显著性图的有效性。

关键词

引用

@article{arxiv.2108.01335,
  title  = {Where do Models go Wrong? Parameter-Space Saliency Maps for Explainability},
  author = {Roman Levin and Manli Shu and Eitan Borgnia and Furong Huang and Micah Goldblum and Tom Goldstein},
  journal= {arXiv preprint arXiv:2108.01335},
  year   = {2022}
}