中文

TEAM-Net:基于部分解码的多模态学习视频动作识别

计算机视觉与模式识别 2021-10-19 v1

摘要

大多数现有视频动作识别模型摄取原始 RGB 帧。然而,原始视频流需要巨大存储并包含显著的时间冗余。视频压缩(如 H.264、MPEG-4)通过使用图像组(GOP)的概念表示原始视频流来减少多余信息。每个 GOP 由首帧 I 帧(即 RGB 图像)及若干 P 帧组成,P 帧由运动向量与残差表示,可被视为并用作预提取特征。在这项工作中,我们 1)引入基于 GOP 级从部分解码视频中为网络采样输入,以及 2)提出一个即插即用的多模态学习模块(TEAM)以端到端方式利用 I 帧与 P 帧的信息训练网络。我们展示了 TEAM-Net 相较仅用 RGB 的基线具有更优性能。TEAM-Net 也在部分解码视频动作识别领域取得最先进性能。代码见 https://github.com/villawang/TEAM-Net。

关键词

引用

@article{arxiv.2110.08814,
  title  = {TEAM-Net: Multi-modal Learning for Video Action Recognition with Partial Decoding},
  author = {Zhengwei Wang and Qi She and Aljosa Smolic},
  journal= {arXiv preprint arXiv:2110.08814},
  year   = {2021}
}

备注

To appear in BMVC 2021