DiscoVLA:面向参数高效视频-文本检索的视觉、语言与对齐差异缩减
计算机视觉与模式识别
2025-06-11 v1
摘要
将图像-文本预训练模型CLIP进行参数高效适配以用于视频-文本检索是一个突出的研究领域。虽然CLIP专注于图像级别的视觉-语言匹配,但视频-文本检索需要在视频级别进行全面的理解。从图像级到视频级的迁移产生了三个关键差异:视觉、语言和对齐。然而,现有方法主要关注视觉而忽略了语言和对齐。在本文中,我们提出了视觉、语言与对齐差异缩减(DiscoVLA),同时缓解所有三个差异。具体而言,我们引入图像-视频特征融合来整合图像级和视频级特征,有效解决视觉和语言差异。此外,我们生成伪图像标题来学习细粒度的图像级对齐。为缓解对齐差异,我们提出图像到视频对齐蒸馏,利用图像级对齐知识增强视频级对齐。大量实验证明了DiscoVLA的优越性。特别地,在MSRVTT数据集上使用CLIP(ViT-B/16),DiscoVLA在R@1上比先前方法高出1.5%,最终达到50.5%的R@1分数。代码可在https://github.com/LunarShen/DsicoVLA获取。
引用
@article{arxiv.2506.08887,
title = {DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval},
author = {Leqi Shen and Guoqiang Gong and Tianxiang Hao and Tao He and Yifeng Zhang and Pengzhang Liu and Sicheng Zhao and Jungong Han and Guiguang Ding},
journal= {arXiv preprint arXiv:2506.08887},
year = {2025}
}
备注
CVPR 2025