中文

面向动作识别的端到端视频级表征学习

计算机视觉与模式识别 2018-04-24 v7

摘要

从帧/片段级特征学习到视频级表征构建,动作识别中的深度学习方法近年来发展迅速。然而,现有方法存在部分观测训练带来的混淆、缺乏端到端学习、或局限于单一时间尺度建模等问题。本文以双流卷积网络为基础,提出具有时间金字塔池化层的深度网络(DTPP),一种端到端视频级表征学习方法,以解决上述问题。具体而言,首先在整个视频中稀疏采样RGB图像与光流栈;随后使用时间金字塔池化层聚合包含空间与时间线索的帧级特征;最后,训练所得模型具备多时间尺度、兼具全局性与序列感知的紧凑视频级表征。实验结果表明,DTPP在UCF101与HMDB51两个具有挑战性的视频动作数据集上均取得了最先进的性能,无论采用ImageNet预训练还是Kinetics预训练。

关键词

引用

@article{arxiv.1711.04161,
  title  = {End-to-end Video-level Representation Learning for Action Recognition},
  author = {Jiagang Zhu and Wei Zou and Zheng Zhu},
  journal= {arXiv preprint arXiv:1711.04161},
  year   = {2018}
}

备注

10 pages, 6 figures, 6 tables. The explanation for the batch size is added. Accepted by ICPR 2018