中文

用于高效视频理解的时序自适应模型

计算机视觉与模式识别 2023-08-14 v1

摘要

空间卷积被广泛应用于众多深度视频模型中。它从根本上假设了时空不变性,即在不同帧中对每个位置使用共享权重。本文提出用于视频理解的时序自适应卷积(TAdaConv),表明沿时间维度进行自适应权重校准是促进视频中复杂时间动态建模的一种高效方式。具体而言,TAdaConv通过根据每帧的局部与全局时间上下文校准卷积权重,赋予空间卷积以时间建模能力。与现有的时间建模操作相比,TAdaConv更高效,因为它在卷积核而非特征上操作,其维度比空间分辨率小一个数量级。此外,核校准带来了增加的模型容量。基于这一即插即用操作TAdaConv及其扩展版TAdaConvV2,我们构建了TAdaBlock以使ConvNeXt和Vision Transformer具备强大的时间建模能力。实证结果表明,TAdaConvNeXtV2和TAdaFormer在各种视频理解基准上可与最先进的基于卷积和基于Transformer的模型竞争。我们的代码和模型发布于:https://github.com/alibaba-mmai-research/TAdaConv。

关键词

引用

@article{arxiv.2308.05787,
  title  = {Temporally-Adaptive Models for Efficient Video Understanding},
  author = {Ziyuan Huang and Shiwei Zhang and Liang Pan and Zhiwu Qing and Yingya Zhang and Ziwei Liu and Marcelo H. Ang},
  journal= {arXiv preprint arXiv:2308.05787},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2110.06178