用于动作检测的双流 AMTnet
计算机视觉与模式识别
2020-04-06 v1
摘要
在本文中,我们提出了 Two-Stream AMTnet,它利用了基于视频的动作表示[1]和增量动作管生成[2]的最新进展。目前大多数动作检测器遵循基于帧的表示、后期融合以及离线动作管构建步骤。这些都是次优的,因为:基于帧的特征几乎不编码时间关系;后期融合限制了网络学习鲁棒的时空特征;最后,离线动作管生成不适用于许多现实世界问题,例如自动驾驶和人机交互等。这项工作的主要贡献是:(1)将 AMTnet 的 3D 提案架构与在线动作管生成技术相结合,这使得模型能够学习准确动作检测所需的更强时间特征,并有助于在线运行推理;(2)一种高效的融合技术,允许深度网络学习强大的时空动作表示。这是通过以三种不同的方式增强先前的 Action Micro-Tube (AMTnet) 动作检测框架来实现的:在本文中,我们提出了一种用于在线动作检测的新型深度神经网络架构,通过在 AMTnet 中原有的外观流旁添加一个并行的运动流;(2)与分别训练外观流和运动流并使用测试时后期融合方案来融合 RGB 和流线索的最先进动作检测器不同,我们以端到端的方式联合训练两个流,并在训练时合并 RGB 和光流特征;(3)引入一种在视频级别工作的在线动作管生成算法,并且能够实时运行(当仅利用外观特征时)。Two-Stream AMTnet 在标准动作检测基准上表现出优于最先进方法的动作检测性能。
引用
@article{arxiv.2004.01494,
title = {Two-Stream AMTnet for Action Detection},
author = {Suman Saha and Gurkirt Singh and Fabio Cuzzolin},
journal= {arXiv preprint arXiv:2004.01494},
year = {2020}
}
备注
8 pages