中文

基于精炼运动矢量的压缩视频动作识别

图像与视频处理 2019-10-08 v1

摘要

尽管CNN已在图像相关任务中达到令人满意的性能,但由于原始视频流体量巨大,使用CNN处理视频更具挑战性。本工作中,我们提出利用现代视频压缩技术中的运动矢量与残差来有效学习原始帧的表示并大幅去除时间冗余,从而得到更快的视频处理模型。压缩视频动作识别(CoViAR)已探索直接利用压缩视频训练深度神经网络,其中运动矢量被用于呈现时间信息。然而,运动矢量设计用于最小化视频大小,并不要求精确的运动信息。与光流相比,运动矢量包含有噪声且不可靠的运动信息。受视频压缩编解码器机制启发,我们提出一种精炼运动矢量的方法,在大量保留时间信息的同时去除不可靠的运动。我们证明,以精炼后的运动矢量替换原始运动矢量,并使用与CoViAR相同的网络,在UCF-101和HMDB-51上取得了SOTA性能,且与原始CoViAR相比效率下降可忽略。

关键词

引用

@article{arxiv.1910.02533,
  title  = {Compressed Video Action Recognition with Refined Motion Vector},
  author = {Haoyuan Cao and Shining Yu and Jiashi Feng},
  journal= {arXiv preprint arXiv:1910.02533},
  year   = {2019}
}

备注

8 pages, 3 figures, 4 tables