中文

具有自适应时间特征分辨率的 3D CNN

计算机视觉与模式识别 2021-08-12 v4

摘要

尽管最先进的 3D 卷积神经网络(CNN)在动作识别数据集上取得了非常好的结果,但它们计算开销极大且需要大量 GFLOPs。虽然可通过降低网络内时间特征分辨率来减少 3D CNN 的 GFLOPs,但不存在对所有输入片段都最优的设置。因此,本工作引入可微分相似性引导采样(SGS)模块,其可插入任何现有 3D CNN 架构。SGS 通过学习时间特征的相似性并将相似特征分组,赋予 3D CNN 能力。结果,时间特征分辨率不再静态,而是随每个输入视频片段变化。通过将 SGS 作为附加层集成到当前 3D CNN 中,我们可将其转化为具有自适应时间特征分辨率(ATFR)的更高效 3D CNN。我们的评估表明,所提模块在保持甚至提升精度的同时,将计算成本(GFLOPs)降低一半,从而改进了最先进水平。我们通过在 Kinetics-600、Kinetics-400、mini-Kinetics、Something-Something V2、UCF101 与 HMDB51 等多种数据集上将模块添加至多个最先进 3D CNN 来进行评估。

关键词

引用

@article{arxiv.2011.08652,
  title  = {3D CNNs with Adaptive Temporal Feature Resolutions},
  author = {Mohsen Fayyaz and Emad Bahrami and Ali Diba and Mehdi Noroozi and Ehsan Adeli and Luc Van Gool and Juergen Gall},
  journal= {arXiv preprint arXiv:2011.08652},
  year   = {2021}
}

备注

CVPR 2021