MV-Adapter:用于视频文本检索的多模态视频迁移学习
计算机视觉与模式识别
2024-04-12 v2
摘要
最先进的视频文本检索(VTR)方法通常涉及在特定数据集上对已预训练模型(如 CLIP)进行全量微调。然而,这在实际应用中会导致显著的存储成本,因为必须为每个任务存储单独的模型。为解决此问题,我们提出开创性工作,利用预训练模型实现参数高效的 VTR,训练时仅少量可调参数。为此,我们提出一种称为多模态视频适配器(MV-Adapter)的新方法,用于高效地将预训练 CLIP 中图像-文本的知识迁移到视频-文本。具体而言,MV-Adapter 在视频与文本分支均采用瓶颈结构,并包含两个新颖组件。其一是时序适应模块,嵌入于视频分支以引入全局与局部时序上下文;我们还训练权重校准以适应跨帧的动态变化。其二是跨模态绑定,通过共享跨模态因子为视频/文本分支生成权重,以更好地对齐模态间。得益于上述创新,MV-Adapter 能以可忽略的参数开销达到与标准全量微调相当或更好的性能。值得注意的是,MV-Adapter 在五个广泛使用的 VTR 基准(MSR-VTT、MSVD、LSMDC、DiDemo 和 ActivityNet)上,于 V2T/T2V 任务中以大幅优势持续优于多种竞争方法。
引用
@article{arxiv.2301.07868,
title = {MV-Adapter: Multimodal Video Transfer Learning for Video Text Retrieval},
author = {Xiaojie Jin and Bowen Zhang and Weibo Gong and Kai Xu and XueQing Deng and Peng Wang and Zhao Zhang and Xiaohui Shen and Jiashi Feng},
journal= {arXiv preprint arXiv:2301.07868},
year = {2024}
}