用于检测视频中多个时空动作管线的深度学习
计算机视觉与模式识别
2016-08-05 v1
摘要
在这项工作中,我们提出了一种在时间未修剪的视频中对多个并发动作进行时空定位(检测)和分类的方法。我们的框架由三个阶段组成。在第一阶段,利用外观和运动检测网络从彩色图像和光流中定位动作并评分。在第二阶段,通过结合运动检测得分(按其各自的空间重叠比例)来提升外观网络的检测结果。在第三阶段,通过动态规划求解两个能量最大化问题,构建最可能与单个动作实例相关联的检测框序列,称为动作管线。虽然在第一遍中,利用特定类别的得分和空间重叠随时间链接检测框以构建跨越整个视频的动作路径,但在第二遍中,通过确保所有组成检测框的标签一致性来执行时间修剪。我们在具有挑战性的 UCF101、J-HMDB-21 和 LIRIS-HARL 数据集上展示了我们算法的性能,全面取得了新的 state-of-the-art 结果,并显著提高了测试时的检测速度。与 state-of-the-art 相比,我们在动作检测性能上实现了巨大飞跃,报告在 UCF-101 和 J-HMDB-21 数据集上的 mAP(平均精度均值)分别提高了 20% 和 11%。
引用
@article{arxiv.1608.01529,
title = {Deep Learning for Detecting Multiple Space-Time Action Tubes in Videos},
author = {Suman Saha and Gurkirt Singh and Michael Sapienza and Philip H. S. Torr and Fabio Cuzzolin},
journal= {arXiv preprint arXiv:1608.01529},
year = {2016}
}
备注
Accepted by British Machine Vision Conference 2016