Side4Video:面向内存高效图像到视频迁移学习的时空侧网络
计算机视觉与模式识别
2023-11-28 v1
摘要
大型预训练视觉模型在计算机视觉中取得了令人瞩目的成功。然而,对大型模型进行下游任务(尤其是视频理解)的全量微调在计算上可能极其昂贵。近期研究将重点转向高效的图像到视频迁移学习。尽管如此,现有高效微调方法缺乏对训练内存占用的关注,也未探索将更大模型迁移至视频领域。本文提出一种新颖的时空侧网络,用于内存高效地微调大型图像模型以进行视频理解,命名为 Side4Video。具体而言,我们引入一个轻量级时空侧网络,附着于冻结的视觉模型,其避免了通过重型预训练模型的反向传播,并利用来自原始图像模型的多级空间特征。极其内存高效的架构使我们的方法比先前基于适配器的方案减少 75% 的内存占用。借此,我们可将一个巨大的 ViT-E(4.4B)迁移用于视频理解任务,其规模是 ViT-L(304M)的 14 倍。我们的方法在单模态与跨模态任务(即动作识别与文本-视频检索)的多个视频数据集上取得了优异性能,特别是在 Something-Something V1&V2(67.3% 与 74.6%)、Kinetics-400(88.6%)、MSR-VTT(52.3%)、MSVD(56.1%)和 VATEX(68.8%)上。我们的代码发布于 https://github.com/HJYao00/Side4Video。
引用
@article{arxiv.2311.15769,
title = {Side4Video: Spatial-Temporal Side Network for Memory-Efficient Image-to-Video Transfer Learning},
author = {Huanjin Yao and Wenhao Wu and Zhiheng Li},
journal= {arXiv preprint arXiv:2311.15769},
year = {2023}
}
备注
Technical report