ZeroI2V:将预训练 Transformer 从图像零代价适配到视频
计算机视觉与模式识别
2024-07-12 v2
摘要
将图像模型适配到视频领域已成为解决视频识别任务的高效范式。由于图像模型参数量巨大且具备有效的可迁移性,进行全量微调效率较低甚至没有必要。因此,近期研究正将重点转向参数高效的图生视频适配。然而,这些适配策略不可避免地引入了额外的计算成本,以应对视频中的领域差异与时序建模。本文提出一种新的适配范式(ZeroI2V),将图像 Transformer 迁移至视频识别任务(即在推理时对原始模型引入零额外成本)。为实现该目标,我们提出两项核心设计。首先,为捕捉视频中的动态信息并降低图生视频适配难度,我们利用自注意力的灵活性,引入时空双头注意力(STDHA)。该方法以零额外参数与计算量为图像 Transformer 高效赋予时序建模能力。其次,为处理图像与视频间的领域差异,我们提出一种线性适配策略,利用轻量密集放置的线性适配器将冻结的图像模型充分迁移至视频识别。得益于定制的线性设计,所有新增适配器在训练后均可通过结构重参数化轻松与原模块合并,从而实现推理时的零额外成本。在具有代表性的全监督与少样本视频识别基准上的大量实验表明,ZeroI2V 在匹配甚至超越先前 SOTA 方法的同时,具备更优的参数与推理效率。
引用
@article{arxiv.2310.01324,
title = {ZeroI2V: Zero-Cost Adaptation of Pre-trained Transformers from Image to Video},
author = {Xinhao Li and Yuhan Zhu and Limin Wang},
journal= {arXiv preprint arXiv:2310.01324},
year = {2024}
}
备注
Accepted by ECCV2024