SAVE:面向视频-文本检索的面向语音视频表征学习
计算机视觉与模式识别
2026-03-12 v2
摘要
对于视频-文本检索,CLIP 已成为事实上的选择。由于 CLIP 只提供图像和文本编码器,这一共识导致偏向性范式,完全忽略了视频的声轨。虽然已有若干尝试重新引入音频——通常通过包含音频编码器并将其输出与视觉特征融合——但这些方法面临两个挑战:语音内容的表征不够有效,以及视觉-音频融合的次优。为同时解决这些问题,我们提出 SAVE,即 Speech Aware Video rEpresentation learning 方法。SAVE 在改进 SOTA 音频视觉方法 AVIGATE 基础上,引入专门的语音分支以实现更有效的语音嵌入。此外,我们引入 soft-ALBEF 以实现早期视觉-音频对齐,促进融合。在五个基准上的大量实验表明,SAVE 在 SumR 指标下相较于 SOTA 方法,在 MSRVTT-9k 上提升 +4.1%,MSRVTT-7k 上提升 +1.9%,VATEX 上提升 +2.5%,Charades 上提升 +9.8%,LSMDC 上提升 +2.1%。
引用
@article{arxiv.2603.08224,
title = {SAVE: Speech-Aware Video Representation Learning for Video-Text Retrieval},
author = {Ruixiang Zhao and Zhihao Xu and Bangxiang Lan and Zijie Xin and Jingyu Liu and Xirong Li},
journal= {arXiv preprint arXiv:2603.08224},
year = {2026}
}
备注
Accepted to CVPR2026