中文

解耦空间与时间学习以实现高效的图像到视频迁移学习

计算机视觉与模式识别 2023-09-15 v1

摘要

近期,如 CLIP 等大规模预训练语言-图像模型展现出理解空间内容的非凡能力,但将此类模型直接迁移至视频识别仍受限于不理想的时间建模能力。现有方法将可调节结构插入预训练模型中或与之并行,这要么需要通过整个预训练模型反向传播因而资源消耗大,要么受限于预训练结构的时间推理能力。本工作中,我们提出 DiST,其解耦视频空间与时间方面的学习。具体而言,DiST 采用双编码器结构,其中预训练基础模型作为空间编码器,并引入轻量网络作为时间编码器。在编码器间插入融合分支以整合时空信息。DiST 中解耦的空间与时间学习极为高效,因其避免了海量预训练参数的反向传播。同时,我们通过实验表明,采用额外网络进行整合的解耦学习有益于空间与时间理解。在五个基准上的大量实验显示,DiST 以令人信服的差距优于现有最先进方法。当在大规模 Kinetics-710 上预训练时,我们以冻结的 ViT-L 模型在 Kinetics-400 上达到 89.7%,验证了 DiST 的可扩展性。代码与模型见 https://github.com/alibaba-mmai-research/DiST。

关键词

引用

@article{arxiv.2309.07911,
  title  = {Disentangling Spatial and Temporal Learning for Efficient Image-to-Video Transfer Learning},
  author = {Zhiwu Qing and Shiwei Zhang and Ziyuan Huang and Yingya Zhang and Changxin Gao and Deli Zhao and Nong Sang},
  journal= {arXiv preprint arXiv:2309.07911},
  year   = {2023}
}

备注

ICCV2023. Code: https://github.com/alibaba-mmai-research/DiST