中文

用于早期动作识别的可解释深度特征传播

计算机视觉与模式识别 2021-07-13 v1

摘要

基于有限初步观测的早期动作识别(动作预测)对需要实时推理的流式视觉系统起着关键作用,因为视频动作常具有拉长的时间跨度,会导致不期望的延迟。在本研究中,我们通过考察动作模式如何在空间特征空间中随时间演化来解决动作预测问题。我们的系统有三个关键组成部分。首先,我们使用中间层 ConvNet 特征,其能从原始数据中抽象,同时保留空间布局。其次,我们传播的不是特征本身,而是它们跨时间的残差,从而实现减少冗余的紧凑表示。第三,我们采用 Kalman 滤波器来抑制误差累积并统一不同预测起始时间。在多个基准上的大量实验结果表明,我们的方法在动作预测中取得了有竞争力的性能。值得注意的是,我们以一种两种方式探究了系统所学组件以揭示其原本不透明的性质。首先,我们证实所学特征传播模块在卷积下作为空间偏移机制工作,将当前观测传播至未来,从而捕获基于流的图像运动信息。其次,所学 Kalman 滤波器自适应更新先验估计以辅助序列学习过程。

关键词

引用

@article{arxiv.2107.05122,
  title  = {Interpretable Deep Feature Propagation for Early Action Recognition},
  author = {He Zhao and Richard P. Wildes},
  journal= {arXiv preprint arXiv:2107.05122},
  year   = {2021}
}