中文

面向 RNN 的激励反向传播

计算机视觉与模式识别 2018-03-09 v3

摘要

深度模型是许多视觉任务(包括视频动作识别与视频描述生成)的最先进方法。模型被训练用于对视频中的活动进行描述或分类,但关于作出此类决策所依据的证据知之甚少。对深度网络决策的依据已在空间视觉内容中有所研究,增进了对图像模型预测的理解。然而,对于时空视觉内容(视频)模型的相关研究相对缺乏。本工作中,我们设计了一种表述,利用自顶向下显著性,在单次前向过程中同时定位空间与时间上的证据。我们使用模型内部表示可视化对深度模型分类/描述生成输出有贡献的时空线索。基于这些时空线索,我们能够在无需显式优化/训练这些任务的情况下,定位视频中与特定动作或描述中短语相对应的片段。

关键词

引用

@article{arxiv.1711.06778,
  title  = {Excitation Backprop for RNNs},
  author = {Sarah Adel Bargal and Andrea Zunino and Donghyun Kim and Jianming Zhang and Vittorio Murino and Stan Sclaroff},
  journal= {arXiv preprint arXiv:1711.06778},
  year   = {2018}
}

备注

CVPR 2018 Camera Ready Version