中文

基于扰动的视频理解网络视觉可解释性方法探究

计算机视觉与模式识别 2020-11-10 v2

摘要

“使黑盒模型可解释”是伴随深度学习网络发展而来的一个重要问题。对于以视觉信息作为输入的神经网络,一种基本但具挑战性的解释方法是识别并可视化主导网络预测的输入像素/区域。然而,现有大多数工作聚焦于解释以单幅图像为输入的神经网络,未考虑视频中存在的时序关系。提供一种适用于多样化视频理解网络结构且易用的视觉解释方法仍是一个开放挑战。本文研究了一种用于视觉解释视频理解网络的通用基于扰动的方法。此外,我们提出了一种新颖的损失函数,通过约束其结果在空间和时间维度上的平滑性来增强该方法。该方法使得不同网络结构间解释结果的比较成为可能,并且可避免为视频输入生成病态对抗性解释。实验比较结果验证了我们所提方法的有效性。

关键词

引用

@article{arxiv.2005.00375,
  title  = {Towards Visually Explaining Video Understanding Networks with Perturbation},
  author = {Zhenqiang Li and Weimin Wang and Zuoyue Li and Yifei Huang and Yoichi Sato},
  journal= {arXiv preprint arXiv:2005.00375},
  year   = {2020}
}

备注

Accepted by WACV2021