中文

视觉识别可解释性综述

计算机视觉与模式识别 2026-03-12 v2

摘要

视觉识别模型在各类任务中取得了空前的成功。尽管研究人员致力于理解这些模型的底层机制,但日益增长的在自动驾驶和医学诊断等安全关键领域部署的需求,加速了可解释人工智能(XAI)的发展。与通用 XAI 不同,视觉识别 XAI 位于视觉与语言的交叉位置,这两者是人类最基本的感知模态,构成了多模态智能的基石。本文从人类中心的角度,基于意图、对象、呈现和方法论,建立了视觉识别 XAI 的多维分类法。除了分类之外,我们总结了关键评估需求和指标,对不同类别进行广泛的定性评估,并在特定维度上进行定量基准测试。此外,我们探讨了多模态大语言模型的可解释性和实际应用,确定了新兴趋势和机遇。通过综合这些多元视角,本综述为激发视觉识别模型可解释性研究提供了深刻的路线图。

关键词

引用

@article{arxiv.2507.11099,
  title  = {A Survey on Interpretability in Visual Recognition},
  author = {Qiyang Wan and Chengzhi Gao and Ruiping Wang and Xilin Chen},
  journal= {arXiv preprint arXiv:2507.11099},
  year   = {2026}
}

备注

20 pages, 8 figures, 7 tables. Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)