Finer-CAM:发现差异揭示更精细细节,用于视觉解释
计算机视觉与模式识别
2025-04-01 v2 人工智能
摘要
类别激活图(CAM)广泛用于突出显示对类别预测有贡献的图像区域。尽管其简单性和计算效率高,但CAM往往难以识别区分视觉上相似的细粒度类别的判别性区域。现有方法通过引入更复杂的解释过程来克服这一限制,但代价是增加了复杂度。本文提出了Finer-CAM方法,既保持CAM的效率,又实现了判别性区域的精确定位。我们的关键洞察是,CAM的缺陷不在于"如何"解释,而在于"解释什么"。具体而言,之前的方法试图识别所有贡献于目标类别logit值的线索,这不无巧地也会激活预测相似类别的区域。通过显式比较目标类别与相似类别并识别其差异,Finer-CAM抑制了与其他类别共享的特征,强调目标类别的独特判别细节。Finer-CAM易于实现,与各种CAM方法兼容,可扩展到多模态模型以准确定位特定概念。此外,Finer-CAM允许可调的比较强度,使用户能够选择性地突出粗糙的物体轮廓或精细的判别细节。定量地,我们展示,使用Finer-CAM激活的像素中最高5%的掩码处理后,与基线方法相比,置信度下降幅度更大。源代码和演示已公开于https://github.com/Imageomics/Finer-CAM。
引用
@article{arxiv.2501.11309,
title = {Finer-CAM: Spotting the Difference Reveals Finer Details for Visual Explanation},
author = {Ziheng Zhang and Jianyang Gu and Arpita Chowdhury and Zheda Mai and David Carlyn and Tanya Berger-Wolf and Yu Su and Wei-Lun Chao},
journal= {arXiv preprint arXiv:2501.11309},
year = {2025}
}
备注
Accepted by CVPR 2025