鸟看起来像汽车:内在可解释深度学习的对抗性分析
机器学习
2025-11-24 v2 计算机视觉与模式识别
摘要
一种普遍的看法是,内在可解释的深度学习模型能确保对其行为正确、直观的理解,并提供更强的鲁棒性以抵御意外错误或故意操纵。然而,这些信念尚未得到全面验证,越来越多的证据对其表示怀疑。在本文中,我们强调了过度依赖这些所谓“内在(又称固有)可解释”模型以及它们易受对抗性操纵的风险。我们引入了两种对抗性分析策略,即针对基于原型网络的原型操纵和后门攻击,并讨论了概念瓶颈模型如何防御这些攻击。通过利用模型对潜在原型的使用来愚弄其推理,揭示了深度神经网络固有的不可解释性,导致由视觉确认偏差强化的虚假安全感。部分原型网络所报告的局限性对其可信度和适用性提出了质疑,激励了在(深度)可解释模型的鲁棒性和对齐方面的进一步工作。
引用
@article{arxiv.2503.08636,
title = {Birds look like cars: Adversarial analysis of intrinsically interpretable deep learning},
author = {Hubert Baniecki and Przemyslaw Biecek},
journal= {arXiv preprint arXiv:2503.08636},
year = {2025}
}
备注
Accepted by Machine Learning