中文

上下文感知 RCNN:视频动作检测的基线

计算机视觉与模式识别 2020-07-21 v1

摘要

视频动作检测方法通常遵循 Faster-RCNN 的标准流程,在 RoI 池化特征上执行以演员为中心的动作识别。在本工作中,我们首先通过经验发现识别准确率与演员的边界框尺寸高度相关,因此更高的演员分辨率有助于更好的性能。然而,视频模型需要在时间上密集采样以实现准确识别。为适配 GPU 显存,送入骨干网络的帧必须保持低分辨率,导致 RoI-Pooling 层中的特征图较为粗糙。因此,我们重新审视 RCNN,通过在特征提取前使用 I3D 深度网络裁剪并调整演员周围的图像块来进行以演员为中心的动作识别。此外,我们发现略微扩展演员边界框并融合上下文特征可进一步提升性能。据此,我们开发了一个令人惊讶地有效的基线(上下文感知 RCNN),并在 AVA 与 JHMDB 两个具有挑战性的动作检测基准上取得了新的当前最优(state-of-the-art)结果。我们的观察挑战了基于 RoI-Pooling 的常规流程,并鼓励研究者重新思考分辨率在以演员为中心的动作识别中的重要性。我们的方法可作为视频动作检测的强基线,并有望为该领域激发新思路。代码见 \url{https://github.com/MCG-NJU/CRCNN-Action}。

关键词

引用

@article{arxiv.2007.09861,
  title  = {Context-Aware RCNN: A Baseline for Action Detection in Videos},
  author = {Jianchao Wu and Zhanghui Kuang and Limin Wang and Wayne Zhang and Gangshan Wu},
  journal= {arXiv preprint arXiv:2007.09861},
  year   = {2020}
}

备注

ECCV 2020 Camera-ready version