Mug-STAN:将图像-语言预训练模型适配于通用视频理解
计算机视觉与模式识别
2023-11-28 v1
摘要
大规模图像-语言预训练模型(如 CLIP)已展现出通过网页规模图像-文本数据获取通用多模态知识的卓越能力。尽管图像-语言模型在各种图像任务上表现优异,如何将其有效扩展至通用视频理解仍是一个持续探索的领域。本文从模型与数据视角研究图像到视频的迁移,揭示了阻碍图像-语言模型适配的两大关键障碍:不可泛化的时序建模与部分错位的视频-文本数据。为应对这些挑战,我们提出带有互引导对齐模块的空间-时序辅助网络(Mug-STAN),一个简单而有效的框架,将图像-文本模型扩展至多样的视频任务与视频-文本数据。具体而言,STAN 采用具有分解的空间-时序模块的支路结构以实现可泛化的时序建模,而 Mug 通过引入任一模态从另一模态的逐 token 特征聚合来抑制错位。大量实验结果验证 Mug-STAN 在视频-文本后预训练与微调阶段显著改善了 CLIP 和 CoCa 等语言-图像预训练模型的适配性。借助我们的方案,在 MSR-VTT、DiDeMo、LSMDC、Kinetics-400、Something-Something-2、HMDB-51、UCF-101 和 AVA 等多个下游数据集上取得了最先进的零样本与微调结果。此外,通过将预训练的 Mug-STAN 与新兴的多模态对话模型结合,我们可实现零样本视频聊天。代码见 https://github.com/farewellthree/STAN
引用
@article{arxiv.2311.15075,
title = {Mug-STAN: Adapting Image-Language Pretrained Models for General Video Understanding},
author = {Ruyang Liu and Jingjia Huang and Wei Gao and Thomas H. Li and Ge Li},
journal= {arXiv preprint arXiv:2311.15075},
year = {2023}
}