FM-G-CAM:计算机视觉中可解释人工智能的整体方法
计算机视觉与模式识别
2026-05-18 v3 人工智能
机器学习
摘要
可解释性是现代人工智能对现实世界影响和可用性的重要方面。本文的主要目标是强调理解计算机视觉模型(特别是卷积神经网络模型)预测的必要性。现有的解释CNN预测的方法主要基于梯度加权类激活映射(Grad-CAM),并且仅关注单个目标类别;这种关于目标类别选择的假设忽略了预测CNN的大部分预测过程。在本文中,我们提出了一种详尽的方法,称为融合多类梯度加权类激活映射(FM-G-CAM),该方法考虑多个最高预测类别,并提供预测CNN推理的整体解释。我们还提供了我们方法的详细数学和算法描述。此外,除了对现有方法进行简要比较外,我们还通过实际用例将FM-G-CAM与Grad-CAM进行定量和定性比较,突出其优势。最后,我们提供了一个开源的Python库,其中包含FM-G-CAM实现,以便方便地生成基于CNN模型预测的显著性图。
引用
@article{arxiv.2312.05975,
title = {FM-G-CAM: A Holistic Approach for Explainable AI in Computer Vision},
author = {Ravidu Suien Rammuni Silva and Jordan J. Bird},
journal= {arXiv preprint arXiv:2312.05975},
year = {2026}
}