中文

ST-ABN:考虑时空信息以用于视频识别的视觉解释方法

计算机视觉与模式识别 2021-11-01 v1

摘要

人们难以解释深度神经网络推理过程中的决策机制。视觉解释是解释深度学习决策的一种方法。它通过可视化突出判别区域的注意力图来分析 2D CNN 的决策。解释视频识别中决策过程的视觉解释更为困难,因为不仅需要考虑空间信息,还需考虑时间信息,这与静态图像情形不同。本文提出一种称为时空注意力分支网络(ST-ABN)的视觉解释方法用于视频识别。它实现了对空间和时间信息的视觉解释。ST-ABN 在网络推理过程中获取空间和时间信息的重要性,并将其应用于识别处理,以提升识别性能和视觉可解释性。在 Something-Something 数据集 V1 与 V2 上的实验结果表明,ST-ABN 能够实现同时考虑空间和时间信息的视觉解释,并提升识别性能。

关键词

引用

@article{arxiv.2110.15574,
  title  = {ST-ABN: Visual Explanation Taking into Account Spatio-temporal Information for Video Recognition},
  author = {Masahiro Mitsuhara and Tsubasa Hirakawa and Takayoshi Yamashita and Hironobu Fujiyoshi},
  journal= {arXiv preprint arXiv:2110.15574},
  year   = {2021}
}

备注

15 pages, 3 figures