DGL:用于文本-视频检索的动态全局-局部提示调优
计算机视觉与模式识别
2024-01-22 v1
摘要
文本-视频检索是一项关键的多模态任务,旨在为文本查询找到最相关的视频。尽管像 CLIP 这样的预训练模型在该领域展现出了令人瞩目的潜力,但由于模型尺寸不断增加,完全微调这些模型的成本上升持续构成一个问题。为了应对这一挑战,提示调优作为一种替代方案应运而生。然而,在将预训练的图像-文本模型适配到下游视频-文本任务时,现有工作仍面临两个问题:(1) 视觉编码器只能编码帧级特征,未能提取全局级通用视频信息。(2) 为视觉和文本编码器配备分离的提示未能缓解视觉-文本模态差距。为此,我们提出了 DGL,一种具有全局-局部视频注意力的跨模态动态提示调优方法。与以往的提示调优方法不同,我们利用共享的潜在空间生成局部级文本和帧提示,以鼓励模态间交互。此外,我们提出在全局-局部注意力机制中对视频进行建模,以从提示调优的角度捕获全局视频信息。大量实验表明,当仅微调 0.67% 的参数时,我们的跨模态提示调优策略 DGL 在 MSR-VTT、VATEX、LSMDC 和 ActivityNet 数据集上的表现优于或可与完全微调方法相媲美。代码将在 https://github.com/knightyxp/DGL 上提供
引用
@article{arxiv.2401.10588,
title = {DGL: Dynamic Global-Local Prompt Tuning for Text-Video Retrieval},
author = {Xiangpeng Yang and Linchao Zhu and Xiaohan Wang and Yi Yang},
journal= {arXiv preprint arXiv:2401.10588},
year = {2024}
}
备注
AAAI2024, Code will be available at https://github.com/knightyxp/DGL