FovEx:面向视觉 Transformer 与卷积神经网络的人类启发式解释
计算机视觉与模式识别
2025-08-01 v3 机器学习
摘要
人工智能(XAI)的可解释性仍然是促进机器学习模型信任与理解的关键方面。当前的可视化解释技术,如基于梯度或基于类激活的方法,往往对特定模型架构具有强烈依赖性。相比之下,扰动基方法尽管具有模型无关性,但需要在大量前向传播上进行评估,计算成本高昂。本文引入 Foveation 基于解释(FovEx),一种受人类视觉启发的新型 XAI 方法。FovEx 通过迭代创建图像的眼睑化渲染,并将其与基于梯度的可视化探索相结合,以高效确定感兴趣的位置。这些位置旨在最大化所要解释模型对于下游任务的性能,然后组合生成归因图。我们对该方法进行了彻底的评估,包括定性和定量评估,使用在各大基准数据集上的测试。该方法在 Transformer(4/5 个指标)和卷积模型(3/5 个指标)上均实现了最佳性能,展示了其在各种架构中的多样性。此外,我们展示了 FovEx 生成的解释图与人类注视图之间的一致性(与 RISE 的 NSS 提升 14%,与 GradCAM 的 NSS 提升 203%)。这一比较增强了我们对 FovEx 缩小人类与机器之间解释鸿沟的能力的信心。
引用
@article{arxiv.2408.02123,
title = {FovEx: Human-Inspired Explanations for Vision Transformers and Convolutional Neural Networks},
author = {Mahadev Prasad Panda and Matteo Tiezzi and Martina Vilas and Gemma Roig and Bjoern M. Eskofier and Dario Zanca},
journal= {arXiv preprint arXiv:2408.02123},
year = {2025}
}
备注
Accepted in the International Journal of Computer Vision (Springer Nature)