基于循环策略网络的预算感知活动检测
计算机视觉与模式识别
2018-05-09 v2
摘要
在本文中,我们解决了未裁剪长视频中高效时序活动检测这一具有挑战性的问题。尽管近期大多数工作聚焦于并提升了检测精度,但在处理单个视频时推理时间可达数秒至数分钟,过慢而难以在实际场景中发挥作用。这促使我们提出预算感知框架,其通过学习根据指定的时间预算智能地选择一小部分帧来执行活动检测。我们将该问题建模为马尔可夫决策过程,并采用循环网络来建模帧选择策略。我们推导了一种基于循环策略梯度的方法,以近似本问题中定义的非可分解且不可微目标的梯度。在大量实验中,我们取得了具有竞争力的检测精度,更重要的是,我们的方法能够大幅减少计算时间,并以每个未裁剪长视频仅 0.35 秒的速度检测多个活动。
引用
@article{arxiv.1712.00097,
title = {Budget-Aware Activity Detection with A Recurrent Policy Network},
author = {Behrooz Mahasseni and Xiaodong Yang and Pavlo Molchanov and Jan Kautz},
journal= {arXiv preprint arXiv:1712.00097},
year = {2018}
}