用于视频归因的时空扰动方法
计算机视觉与模式识别
2021-09-02 v1
摘要
归因方法通过识别并可视化主导网络输入的输入区域/像素,为以视觉方式解释不透明神经网络提供了方向。对于视觉解释视频理解网络的归因方法,由于视频输入中存在的独特时空依赖关系以及视频理解网络特殊的3D卷积或循环结构,该任务具有挑战性。然而,大多数现有归因方法聚焦于解释以单幅图像为输入的网络,少数专为视频归因设计的工作难以处理视频理解网络的多样化结构。本文中,我们研究了一种兼容多样化视频理解网络的基于扰动的通用归因方法。此外,我们提出了一种新颖的正则化项,通过约束其归因结果在空间和时间维度上的平滑性来增强该方法。为了在不依赖人工判断的情况下评估不同视频归因方法的有效性,我们引入了可靠的客观指标,并通过新提出的可靠性度量进行校验。我们通过主观和客观评估以及与多种重要归因方法的比较,验证了方法的有效性。
引用
@article{arxiv.2109.00222,
title = {Spatio-Temporal Perturbations for Video Attribution},
author = {Zhenqiang Li and Weimin Wang and Zuoyue Li and Yifei Huang and Yoichi Sato},
journal= {arXiv preprint arXiv:2109.00222},
year = {2021}
}