Winsor-CAM:通过图层级 Winsorization 实现人类可调节的深度网络可解释性
摘要
解释卷积神经网络 (CNN) 对医疗和自动驾驶系统等安全敏感应用至关重要。诸如 Grad-CAM 等流行的可视化解释方法仅使用单个卷积层,可能忽略多尺度线索并产生不稳定的显著性图。我们引入 Winsor-CAM,一种单次梯度方法,通过聚合所有卷积层的 Grad-CAM 图并应用基于百分位的 Winsorization 来减弱异常贡献。用户可调节的百分位参数 p 启用从低级纹理到高级对象模式的语义级调优。我们在六种 CNN 架构上使用 PASCAL VOC 2012 和 PolypGen 进行评估,比较了定位 (IoU、重心距离) 和保真度 (插入/删除 AUC) 与包括 Grad-CAM、Grad-CAM++、LayerCAM、ScoreCAM、AblationCAM、ShapleyCAM 和 FullGrad 在内的七个基线方法。在 DenseNet121 上使用 PASCAL VOC 2012 的子集,Winsor-CAM 实现了 46.8% 的 IoU 和 0.059 的 CoM 距离,分别相对于 Grad-CAM 的 39.0% 和 0.074,且在插入 AUC (0.656 vs. 0.623) 和删除 AUC (0.197 vs. 0.242) 上均有所改进。值得注意的是,即使最差的固定 p 值配置也在所有指标上超越 FullGrad。消融研究确认包含更早层次有助于改善定位。在 PolypGen 多项肠瘤分割上的类似评估进一步验证了 Winsor-CAM 在医学影像上下文中的有效性。Winsor-CAM 提供了一个高效、稳健且具有人类可调节性的解释工具,用于专家-in-the-loop 分析。
引用
@article{arxiv.2507.10846,
title = {Winsor-CAM: Human-Tunable Visual Explanations from Deep Networks via Layer-Wise Winsorization},
author = {Casey Wall and Longwei Wang and Rodrigue Rizk and KC Santosh},
journal= {arXiv preprint arXiv:2507.10846},
year = {2026}
}
备注
19 pages, 11 figures, 12 tables. Accepted for publication in IEEE Transactions on Pattern Analysis and Machine Intelligence