中文

从图像到视频 Transformer 的双路径适配

计算机视觉与模式识别 2023-03-20 v1 机器学习

摘要

在本文中,我们以极少可训练参数高效地将视觉基础模型(如 ViT 和 Swin)卓越的表征能力迁移至视频理解。先前的适配方法通过统一可学习模块同时考虑空间与时间建模,但仍未能充分利用图像 Transformer 的表征能力。我们认为视频模型中流行的双路径(双流)架构可缓解此问题。我们提出一种新颖的 DualPath 适配,分为空间与时间适配路径,其中在每个 Transformer 块中采用轻量瓶颈适配器。尤其对于时间动态建模,我们将连续帧组合为类网格帧集,以精确模仿视觉 Transformer 推断 token 间关系的能力。此外,我们从统一视角广泛考察视频理解中的多种基线并与 DualPath 比较。在四个动作识别基准上的实验结果证明,带有 DualPath 的预训练图像 Transformer 可有效泛化至数据域之外。

关键词

引用

@article{arxiv.2303.09857,
  title  = {Dual-path Adaptation from Image to Video Transformers},
  author = {Jungin Park and Jiyoung Lee and Kwanghoon Sohn},
  journal= {arXiv preprint arXiv:2303.09857},
  year   = {2023}
}

备注

CVPR 2023. Code is available at https://github.com/park-jungin/DualPath