AIM:用于评估显著图忠诚度的对抗信息掩码
机器学习
2026-05-19 v1 计算机视觉与模式识别
摘要
后验显著方法广泛用于解释深层神经网络,但其忠诚度难以可靠评估。现有评估方法根据显著引导的特征排序进行特征掩码处理,并衡量性能下降,但这种下降可能受到掩码算子的影响:零掩码可能产生分布外伪影,而插值式掩码可能保留残余预测信息。我们提出对抗信息掩码(AIM),一种用于评估显著图忠诚度和掩码算子可靠性的显著引导对抗特征替换框架。AIM替换所选特征为来自输入对抗对等物的值,并比较在互补掩码顺序下的性能下降。我们使用随机归因偏差和解释方法忠诚度排名的稳定性来评估可靠性。在图像、音频和EEG任务上的实验表明,AIM相对于零掩码和插值式掩码方法可显著降低掩码引起的偏差,同时揭示了有符号和无符号归因在不同模态下的差异。
引用
@article{arxiv.2605.16905,
title = {AIM: Adversarial Information Masking for Faithfulness Evaluation of Saliency Maps},
author = {Chia-Ying Hsieh and Hsin-Yuan Fang and Chun-Shu Wei},
journal= {arXiv preprint arXiv:2605.16905},
year = {2026}
}