压缩视频动作识别
计算机视觉与模式识别
2018-04-02 v2
摘要
训练鲁棒的深层视频表示已被证明比学习深层图像表示更具挑战性。这部分是由于原始视频流的庞大尺寸和高时间冗余;真实且有趣的信号常常淹没在过多无关数据中。鉴于通过视频压缩(使用 H.264、HEVC 等)可将多余信息减少多达两个数量级,我们提出直接在压缩视频上训练深度网络。该表示具有更高的信息密度,且我们发现训练更为容易。此外,压缩视频中的信号提供了免费但含噪的运动信息。我们提出了有效利用这些信息的新技术。我们的方法比 Res3D 快约 4.6 倍,比 ResNet-152 快约 2.7 倍。在动作识别任务上,我们的方法在 UCF-101、HMDB-51 和 Charades 数据集上优于所有其他方法。
引用
@article{arxiv.1712.00636,
title = {Compressed Video Action Recognition},
author = {Chao-Yuan Wu and Manzil Zaheer and Hexiang Hu and R. Manmatha and Alexander J. Smola and Philipp Krähenbühl},
journal= {arXiv preprint arXiv:1712.00636},
year = {2018}
}
备注
CVPR 2018 (Selected for spotlight presentation)