中文

用于可视化解释视频识别网络的自适应遮挡敏感性分析

计算机视觉与模式识别 2023-08-21 v2

摘要

本文提出一种通过遮挡敏感性分析的时间扩展来可视化解释视频识别网络决策过程的方法,称为自适应遮挡敏感性分析(AOSA)。其核心思想是在输入的三维时空数据空间中用 3D 掩码遮挡特定数据体,然后测量输出分数的变化程度。产生较大变化程度的被遮挡体数据被视为对分类更关键的元素。然而,尽管遮挡敏感性分析常用于分析单图像分类,将这一思想应用于视频分类并不直截了当,因为简单的固定长方体无法处理复杂运动。为解决此问题,我们参考运动自适应地设置 3D 遮挡掩码的形状。我们灵活的掩码自适应通过考虑从输入视频数据提取的光流的时间连续性与空间共现来实现。我们进一步提出一种新方法,利用输出分数相对于输入视频的一阶近似来降低所提方法的计算成本。我们在 UCF101 数据集以及 Kinetics-400 和 700 数据集上,通过删除/插入度量和指向度量与传统方法的各种广泛比较,证明了我们方法的有效性。

关键词

引用

@article{arxiv.2207.12859,
  title  = {Adaptive occlusion sensitivity analysis for visually explaining video recognition networks},
  author = {Tomoki Uchiyama and Naoya Sogi and Satoshi Iizuka and Koichiro Niinuma and Kazuhiro Fukui},
  journal= {arXiv preprint arXiv:2207.12859},
  year   = {2023}
}

备注

11 pages