ST-Adapter:参数高效的图像到视频迁移学习
计算机视觉与模式识别
2022-10-14 v3
摘要
利用大型预训练模型处理各类感兴趣的下游任务近期崭露头角并展现出可喜性能。由于模型规模不断增长,基于标准全微调的任务适配策略在模型训练与存储上变得极其昂贵。这催生了参数高效迁移学习这一新研究方向。然而,现有尝试通常聚焦于与预训练模型同模态(如图像理解)的下游任务。这造成了局限,因为在某些特定模态(如视频理解)中,具备充足知识的此类强预训练模型较少或不可用。本工作中,我们探究这样一种新颖的跨模态迁移学习设定,即参数高效的图像到视频迁移学习。为解决这个问题,我们提出一种新的时空适配器(ST-Adapter)用于按视频任务进行参数高效微调。凭借紧凑设计中内建的时空推理能力,ST-Adapter使不具备时间知识的预训练图像模型能以较小的(约8%)每任务参数代价推理动态视频内容,相较先前工作所需更新参数约少20倍。在视频动作识别任务上的大量实验表明,我们的ST-Adapter可匹敌甚至超越强全微调策略与最先进视频模型,同时享有参数高效的优势。代码与模型见于 https://github.com/linziyi96/st-adapter
引用
@article{arxiv.2206.13559,
title = {ST-Adapter: Parameter-Efficient Image-to-Video Transfer Learning},
author = {Junting Pan and Ziyi Lin and Xiatian Zhu and Jing Shao and Hongsheng Li},
journal= {arXiv preprint arXiv:2206.13559},
year = {2022}
}
备注
Accepted in NeurIPS 2022