通过对抗训练实现可解释计算机视觉模型:揭示鲁棒性与可解释性的关联
计算机视觉与模式识别
2023-11-21 v2
摘要
随着最先进的深度神经网络复杂性的持续增长,保持其可解释性成为一项愈发具有挑战性的任务。我们的工作旨在评估用于生成鲁棒模型(即不易受对抗攻击影响的模型)的对抗训练的效果。已有研究表明对抗训练能使计算机视觉模型更具可解释性。当我们把模型部署到现实世界中时,可解释性与鲁棒性同等重要。为证明这两个问题之间的相关性,我们使用局部特征重要性方法(SHAP、Integrated Gradients)和特征可视化技术(Representation Inversion、Class Specific Image Generation)对模型进行了广泛检验。与鲁棒模型相比,标准模型更易受到对抗攻击,且其学到的表征对人类而言意义较小。相反,这些模型聚焦于支持其预测的图像中的显著区域。此外,鲁棒模型学到的特征更接近于真实特征。
引用
@article{arxiv.2307.02500,
title = {Interpretable Computer Vision Models through Adversarial Training: Unveiling the Robustness-Interpretability Connection},
author = {Delyan Boychev},
journal= {arXiv preprint arXiv:2307.02500},
year = {2023}
}
备注
13 pages, 19 figures, 6 tables