信任型显著性图的训练:对抗训练融合特征图平滑化
计算机视觉与模式识别
2026-03-10 v1
摘要
梯度基显著性方法如Vanilla Gradient(VG)和Integral Gradients(IG)广泛用于解释图像分类器,但生成的图谱常呈噪声且不稳定,限制其在高风险场景中的实用性。大多数先行工作通过修改归因算法改进解释,未充分考量训练程序如何塑造解释质量。我们从训练中心视角出发,首先提供基于曲率的分析,将归因稳定性与输入梯度场局部平滑性联系起来。指导此联系,我们研究对抗训练,识别出一致性权衡:其产生稀疏且更输入稳定的显著性图,但可能损害输出侧稳定性,导致即使预测不变且逻辑仅轻微变化时,解释也发生改变。为缓解此问题,我们提出在中间层应用可微高斯滤波器的轻量级特征图平滑模块。跨FMNIST、CIFAR-10和ImageNette实验表明,本方法保留对抗训练的稀疏性优势,同时提升输入侧及输出侧稳定性。人类研究包含65名参与者,进一步表明平滑后的对抗显著性图被认为更充分且更可信。总体而言,我们的结果表明解释质量严重受训练影响,简单平滑与稳健训练提供了通向稀疏且稳定显著性图的实用路径。
引用
@article{arxiv.2603.07302,
title = {Training for Trustworthy Saliency Maps: Adversarial Training Meets Feature-Map Smoothing},
author = {Dipkamal Bhusal and Md Tanvirul Alam and Nidhi Rastogi},
journal= {arXiv preprint arXiv:2603.07302},
year = {2026}
}