中文

用于视频时间活动检测的粗-细网络

计算机视觉与模式识别 2021-04-02 v2

摘要

本文提出 Coarse-Fine Networks,一种双流架构,其利用不同时间分辨率抽象来学习更好的长时运动视频表示。传统视频模型以单一(或少数)固定时间分辨率处理输入,无任何动态帧选择。然而,我们认为,对输入处理多种时间分辨率,并通过学习估计每帧重要性来动态地进行,可大幅改进视频表示,尤其在时间活动定位领域。为此,我们提出(1)Grid Pool,一种用于提取粗特征的学习型时间下采样层;以及(2)Multi-stage Fusion,一种将细粒度上下文与粗特征融合的时空注意力机制。我们表明,在包括 Charades 在内的公开数据集上,我们的方法以显著减少的计算与内存开销超越了动作检测的当前最优(state-of-the-art)方法。代码见 https://github.com/kkahatapitiya/Coarse-Fine-Networks

关键词

引用

@article{arxiv.2103.01302,
  title  = {Coarse-Fine Networks for Temporal Activity Detection in Videos},
  author = {Kumara Kahatapitiya and Michael S. Ryoo},
  journal= {arXiv preprint arXiv:2103.01302},
  year   = {2021}
}

备注

To appear at CVPR 2021