基于核主成分分析的深度计算机视觉模型可视化解释性方法
计算机视觉与模式识别
2024-10-02 v1 人工智能
摘要
深度学习模型常以黑箱形式存在,为其预测提供无直接推理依据。这一点尤其适用于计算机视觉模型,这些模型处理像素值张量以生成图像分类和目标检测等任务中的结果。为了阐明这些模型的推理过程,常用类激活图(CAM)来突出影响模型输出的显著区域。本研究引入 KPCA-CAM 技术,通过改进类激活图来增强卷积神经网络(CNN)的可解释性。KPCA-CAM 利用带核技巧的主成分分析(PCA)来更有效地捕捉 CNN 激活中的非线性关系。通过将数据映射到更高维空间的核函数,并从转换后的超平面中提取主成分,KPCA-CAM 提供更准确地代表数据流形的表征。这使得更深入地理解影响 CNN 决策的特征。在 ILSVRC 数据集上对不同 CNN 模型进行的经验评估表明,KPCA-CAM 产生更精确的激活图,为模型推理提供了更清晰的洞察,优于现有 CAM 算法。本研究推进了 CAM 技术,为研究人员和实践者提供了一个强大的工具,以更深入地了解 CNN 决策过程及整体行为。
引用
@article{arxiv.2410.00267,
title = {KPCA-CAM: Visual Explainability of Deep Computer Vision Models using Kernel PCA},
author = {Sachin Karmani and Thanushon Sivakaran and Gaurav Prasad and Mehmet Ali and Wenbo Yang and Sheyang Tang},
journal= {arXiv preprint arXiv:2410.00267},
year = {2024}
}
备注
5 pages, 4 figures, Published to IEEE MMSP 2024