中文

探索视频动作识别中的可解释性

计算机视觉与模式识别 2024-04-16 v1 人工智能

摘要

图像分类和视频动作识别可能是计算机视觉中最基础的两个任务。因此,解释训练好的深度神经网络内部工作机制至关重要。尽管已有大量工作致力于解释图像分类中训练好的深度神经网络的决策,但在其时间版本,即视频动作识别领域的探索却很少。在这项工作中,我们更深入地审视了这个问题。我们首先回顾了图像分类中流行的特征归因方法之一 Grad-CAM,及其在视频动作识别任务中的扩展,并检验了该方法的局限性。为了解决这些问题,我们在图像分类任务的 TCAV 基础上进行构建,引入了 Video-TCAV,旨在量化特定概念在视频动作识别模型决策过程中的重要性。由于概念的可扩展生成仍然是一个开放性问题,我们提出了一种机器辅助方法来生成与视频动作识别相关的空间和时空概念,用于测试 Video-TCAV。然后,我们通过证明动态时空概念优于平凡的空间概念,确立了时变概念的重要性。总之,我们引入了一个用于研究动作识别中的假设并进行定量测试的框架,从而推进了用于视频动作识别的深度神经网络可解释性研究。

关键词

引用

@article{arxiv.2404.09067,
  title  = {Exploring Explainability in Video Action Recognition},
  author = {Avinab Saha and Shashank Gupta and Sravan Kumar Ankireddy and Karl Chahine and Joydeep Ghosh},
  journal= {arXiv preprint arXiv:2404.09067},
  year   = {2024}
}

备注

6 pages, 10 figures, Accepted to the 3rd Explainable AI for Computer Vision (XAI4CV) Workshop at CVPR 2024