关于 1-Lipschitz 神经网络的可解释性质:最优传输视角
人工智能
2024-02-05 v3 密码学与安全
计算机视觉与模式识别
机器学习
机器学习
摘要
输入梯度在多种应用中起关键作用,包括用于评估模型鲁棒性的对抗攻击算法、生成显著图的 Explainable AI(XAI)技术以及反事实解释。然而,传统神经网络生成的显著图通常含噪且提供的信息有限。本文中我们证明,相反地,以最优传输问题的对偶损失学习的 1-Lipschitz 神经网络的显著图展现出理想的 XAI 性质:它们高度集中于图像关键部分且噪声低,在各种模型和指标上显著优于最先进的解释方法。我们还证明这些图在 ImageNet 上与人类解释空前地吻合。为解释此类模型的显著图特别有益的性质,我们证明该梯度同时编码了传输计划的方向和最近对抗攻击的方向。沿梯度下降至决策边界不再被视为对抗攻击,而是将输入从一类显式传输至另一类的反事实解释。因此,以此类损失学习联合优化了分类目标和梯度(即显著图)与传输计划方向的对齐。这些网络此前已知为设计上可证明鲁棒,而我们证明它们对大规模问题和模型具有良好的可扩展性,并适用于以快速直接方法进行可解释性分析。
引用
@article{arxiv.2206.06854,
title = {On the explainable properties of 1-Lipschitz Neural Networks: An Optimal Transport Perspective},
author = {Mathieu Serrurier and Franck Mamalet and Thomas Fel and Louis Béthune and Thibaut Boissin},
journal= {arXiv preprint arXiv:2206.06854},
year = {2024}
}