中文

STAU:一种用于视频预测及更多任务的时空感知单元

计算机视觉与模式识别 2022-04-21 v1

摘要

视频预测旨在通过建模视频中复杂的时空动态来预测未来帧。然而,现有多数方法仅以独立方式对视频的时间信息与空间信息建模,未能充分挖掘二者间的相关性。本文中,我们提出一种时空感知单元(STAU),用于视频预测及更广泛任务,通过探索视频中显著的时空相关性来实现。一方面,从空间状态中学习运动感知注意力权重,以帮助在时间域中聚合时间状态;另一方面,从时间状态中学习外观感知注意力权重,以帮助在空间域中聚合空间状态。如此,时间信息与空间信息在这两个域中可充分感知彼此,在此过程中,时空感受野也得以大幅拓宽,从而实现更可靠的时空建模。实验不仅在传统视频预测任务上开展,也涵盖视频预测之外的其他任务,包括早期动作识别与目标检测任务。实验结果表明,我们的 STAU 在所有任务上的性能与计算效率均优于其他方法。

关键词

引用

@article{arxiv.2204.09456,
  title  = {STAU: A SpatioTemporal-Aware Unit for Video Prediction and Beyond},
  author = {Zheng Chang and Xinfeng Zhang and Shanshe Wang and Siwei Ma and Wen Gao},
  journal= {arXiv preprint arXiv:2204.09456},
  year   = {2022}
}

备注

This work has been submitted to TPAMI