用于压缩视频动作识别的流蒸馏 IP 双流网络
计算机视觉与模式识别
2019-12-13 v2
摘要
双流网络在视频识别中取得了巨大成功。双流网络结合 RGB 帧的空间流与光流的时间流进行预测。然而,RGB 帧的时间冗余以及光流计算的高成本给性能和效率都带来了挑战。近期工作转而使用现代压缩视频模态作为 RGB 空间流的替代,并将推理速度提升了数个数量级。以往工作为每种模态创建一个流,并通过后期融合与额外的时间流结合。这是冗余的,因为某些模态(如运动向量)已经包含了时间信息。基于这一观察,我们提出一种用于压缩视频识别的压缩域双流网络 IP TSN,其中两条流由压缩视频中的两类帧(I 帧和 P 帧)表示,无需单独的时间流。为此,我们提出通过来自光流的广义蒸馏充分利用 P 流的运动信息,大幅提升了效率和准确率。我们的 P 流比使用光流快 60 倍,同时达到更高准确率。我们的完整 IP TSN 在公开动作识别基准(UCF101、HMDB51 和 Kinetics 的一个子集)上评估,以大幅优势优于其他压缩域方法,同时将总推理速度提升了 20%。
引用
@article{arxiv.1912.04462,
title = {Flow-Distilled IP Two-Stream Networks for Compressed Video Action Recognition},
author = {Shiyuan Huang and Xudong Lin and Svebor Karaman and Shih-Fu Chang},
journal= {arXiv preprint arXiv:1912.04462},
year = {2019}
}