STEP:用于视频动作检测的时空渐进学习
计算机视觉与模式识别
2019-04-22 v1
摘要
本文中,我们提出时空渐进(STEP)动作检测器——一种用于视频中时空动作检测的渐进学习框架。从少量粗尺度提议长方体出发,我们的方法在若干步内逐步将提议细化至动作。以此方式,通过利用前一步的回归输出,可在后续步骤中逐渐获得高质量提议(即贴合动作运动)。在每一步,我们自适应地在时间上扩展提议以纳入更多相关时间上下文。相较于一次性完成动作检测的先前工作,我们的渐进学习框架能够自然处理动作管内的空间位移,从而提供一种更有效的时空建模方式。我们在 UCF101 与 AVA 上广泛评估了我们的方法,并展示了优越的检测结果。值得注意的是,在 3 个渐进步骤下,仅分别使用 11 和 34 个初始提议,我们在两个数据集上取得了 75.0% 和 18.6% 的 mAP。
引用
@article{arxiv.1904.09288,
title = {STEP: Spatio-Temporal Progressive Learning for Video Action Detection},
author = {Xitong Yang and Xiaodong Yang and Ming-Yu Liu and Fanyi Xiao and Larry Davis and Jan Kautz},
journal= {arXiv preprint arXiv:1904.09288},
year = {2019}
}
备注
CVPR 2019 (Oral)