AMTnet:基于端到端可训练深度架构的动作微管回归
计算机视觉与模式识别
2017-08-08 v2
摘要
动作检测的主流方法只能提供该问题的次优解,因为它们依赖于寻求帧级检测,然后在后处理步骤中将其组合成“动作管”。本文中我们彻底背离当前做法,并朝设计和实现能够分类和回归整个视频子集的深度网络架构迈出第一步,从而提供动作检测问题的真正最优解。具体而言,在这项工作中,我们提出了一种新颖的深度网络框架,能够回归和分类跨越两个连续视频帧的3D区域提议,其核心是经典区域提议网络(RPNs)的一种演进。因此,我们的3D-RPN网络能够通过纯粹利用表观来有效编码动作的时间方面,这与严重依赖昂贵光流图的方法相反。所提出的模型是端到端可训练的,并且可以在单步中联合优化用于动作定位与分类。在测试时,网络预测涵盖两个连续帧的“微管”,这些微管通过一种新算法链接成完整的动作管,该算法利用了网络学习到的时间编码并将计算时间减少了50%。在J-HMDB-21和UCF-101动作检测数据集上的有前景的结果表明,当纯粹依赖表观时,我们的模型确实优于最先进水平。
引用
@article{arxiv.1704.04952,
title = {AMTnet: Action-Micro-Tube Regression by End-to-end Trainable Deep Architecture},
author = {Suman Saha and Gurkirt Singh and Fabio Cuzzolin},
journal= {arXiv preprint arXiv:1704.04952},
year = {2017}
}
备注
Update to version in ICCV 2017 proceedings