重新审视鲁棒性:评估特征归因方法的新方法
机器学习
2025-12-09 v1 人工智能
计算机视觉与模式识别
摘要
本文研究了深度神经网络的特征归因方法的鲁棒性。它挑战了当前很大程度上忽略模型输出差异的归因鲁棒性观念,并引入了一种评估归因方法鲁棒性的新方法。具体而言,我们提出了相似输入的新定义、新的鲁棒性指标,以及基于生成对抗网络生成这些输入的新方法。此外,我们对现有指标和最先进的归因方法进行了全面评估。我们的发现揭示了对归因方法鲁棒性进行更客观评估的必要性,这种评估应揭示归因方法的弱点而非神经网络的弱点,从而提供对归因方法鲁棒性更准确的评估。
引用
@article{arxiv.2512.06665,
title = {Rethinking Robustness: A New Approach to Evaluating Feature Attribution Methods},
author = {Panagiota Kiourti and Anu Singh and Preeti Duraipandian and Weichao Zhou and Wenchao Li},
journal= {arXiv preprint arXiv:2512.06665},
year = {2025}
}