CFAD: 用于时空动作定位的由粗到精动作检测器
计算机视觉与模式识别
2020-08-20 v1
摘要
当前大多数时空动作定位流程通过连接逐帧或逐片段的检测结果来生成动作提议,仅利用了局部信息,且因密集的逐帧定位而效率受限。本文提出由粗到精动作检测器(CFAD),一种高效的端到端可训练时空动作定位框架。CFAD 引入了一种新范式:首先从视频流估计粗略的时空动作管,随后基于关键时间戳细化管的位置。该概念由框架中的两个关键组件——粗化模块与细化模块实现。粗化模块中对长时信息的参数化建模有助于获得准确的初始管估计,而细化模块在关键时间戳引导下选择性调整管的位置。与其他方法相比,所提 CFAD 在 UCF101-24、UCFSports 与 JHMDB-21 动作检测基准上取得了具竞争力的结果,推理速度比最接近的竞争对手快 3.3 倍。
引用
@article{arxiv.2008.08332,
title = {CFAD: Coarse-to-Fine Action Detector for Spatiotemporal Action Localization},
author = {Yuxi Li and Weiyao Lin and John See and Ning Xu and Shugong Xu and Ke Yan and Cong Yang},
journal= {arXiv preprint arXiv:2008.08332},
year = {2020}
}
备注
7 figures, 3 tables; ECCV2020