中文

GTM:用于视频识别的灰度时序模型

计算机视觉与模式识别 2021-10-22 v1

摘要

数据输入模态在视频动作识别中起着重要作用。通常有三种输入类型:RGB、光流和压缩数据。在本文中,我们提出了一种新的输入模态:灰度流。具体而言,以堆叠的连续 3 张灰度图像作为输入,其尺寸与 RGB 相同,不仅可以跳过从视频解码数据到 RGB 的转换过程,还可以以零计算和零参数提高时空建模能力。同时,我们提出了一种一维恒等通道时空卷积(1D-ICSC),其在可控的计算预算(通过参数 G 和 R)下捕获通道特征级别的时间关系。最后,我们在多个动作识别基准(如 Kinetics、Something-Something、HMDB-51 和 UCF-101)上确认了其有效性和效率,并取得了令人印象深刻的结果。

关键词

引用

@article{arxiv.2110.10348,
  title  = {GTM: Gray Temporal Model for Video Recognition},
  author = {Yanping Zhang and Yongxin Yu},
  journal= {arXiv preprint arXiv:2110.10348},
  year   = {2021}
}