中文

DynamoNet:动态动作与运动网络

计算机视觉与模式识别 2019-04-26 v1

摘要

在本文中,我们关注于利用动态运动滤波器对视频中的运动线索进行自监督学习,以获得更好的运动表示,并最终特别地提升人体动作识别。迄今为止,视觉界主要关注使用标准滤波器的时空方法,而我们在本文中提出动态滤波器,其通过预测短期未来帧来自适应地学习视频特定的内部运动表示。我们将这种新的运动表示命名为动态运动表示(DMR),并将其作为新层嵌入到 3D 卷积网络内部,通过端到端网络学习捕获整个视频片段中的视觉外观和运动动态。同时,我们利用这些运动表示来丰富视频分类。我们将帧预测任务设计为一个辅助任务以增强分类问题。基于这些总体目标,我们最终引入了一种新颖的统一时空 3D-CNN 架构(DynamoNet),它将视频分类和学习运动表示作为多任务学习问题通过预测未来帧来联合优化。我们在具有挑战性的人体动作数据集上进行了实验:Kinetics 400、UCF101、HMDB51。使用所提出的 DynamoNet 的实验在所有数据集上均显示出有前景的结果。

关键词

引用

@article{arxiv.1904.11407,
  title  = {DynamoNet: Dynamic Action and Motion Network},
  author = {Ali Diba and Vivek Sharma and Luc Van Gool and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:1904.11407},
  year   = {2019}
}