TextCAM:用文本解释类激活图
计算机视觉与模式识别
2025-10-02 v1 人工智能
机器学习
摘要
深度神经网络(DNN)在多个领域取得了显著的成功,但仍然难以解释,这限制了其在高风险应用中的可信度。这篇论文聚焦于深度视觉模型,现有的解释方法主要是类激活图(CAM)及其变体,通过突出显示驱动预测的空间区域来工作。我们发现,CAM 对这些激活背后的属性几乎没有提供语义洞察。为此,我们提出了 TextCAM,一种新颖的解释框架,通过自然语言丰富 CAM。TextCAM 将 CAM 的精确空间局部化与视觉语言模型(VLM)的语义对齐相结合。具体而言,我们使用 CLIP 嵌入和线性判别分析推导出通道级语义表示,并将其与 CAM 权重聚合,以生成显著视觉证据的文本描述。这使得解释能够同时指定模型关注的地方以及可能支持其决策的视觉属性。我们进一步将 TextCAM 扩展到将特征通道生成语义连贯的组,从而实现更细粒度的视觉-文本解释。在 ImageNet、CLEVR 和 CUB 上的实验表明,TextCAM 产生的忠实且可解释的论点,改善了人类理解,检测了虚假关联,并保持了模型保真度。
引用
@article{arxiv.2510.01004,
title = {TextCAM: Explaining Class Activation Map with Text},
author = {Qiming Zhao and Xingjian Li and Xiaoyu Cao and Xiaolong Wu and Min Xu},
journal= {arXiv preprint arXiv:2510.01004},
year = {2025}
}