中文

在单帧中捕获时间信息:用于动作识别的通道采样策略

计算机视觉与模式识别 2022-10-11 v3

摘要

我们解决了在2D网络中捕获视频分类时间信息而不增加其计算成本的问题。现有方法侧重于修改2D网络的架构(例如通过在时间维度上加入滤波器将其变为3D网络,或使用光流等),这增加了计算成本。相反,我们提出了一种新颖的采样策略,通过对输入视频的通道重新排序来捕获短期的帧间变化。我们观察到,无需任何额外技巧,所提出的采样策略在多个架构(如TSN、TRN、TSM和MVFNet)和数据集(CATER、Something-Something-V1和V2)上提升了性能,比使用标准视频输入的基线高出最多24%。此外,我们的采样策略不需要从头训练,也不会增加训练和测试的计算成本。鉴于结果的通用性和方法的灵活性,我们希望这能对视频理解社区有广泛的用处。代码已在我们的网站提供:https://github.com/kiyoon/channel_sampling。

关键词

引用

@article{arxiv.2201.10394,
  title  = {Capturing Temporal Information in a Single Frame: Channel Sampling Strategies for Action Recognition},
  author = {Kiyoon Kim and Shreyank N Gowda and Oisin Mac Aodha and Laura Sevilla-Lara},
  journal= {arXiv preprint arXiv:2201.10394},
  year   = {2022}
}

备注

BMVC 2022