基于语义方差缩放扰动的帧级门控音视频集成:GAIS 用于文本-视频检索
计算机视觉与模式识别
2025-11-19 v2 人工智能
摘要
文本到视频检索需要在语言与时序丰富的音视频信号之间实现精确对齐。然而,现有方法常侧重视觉线索, underutilize 音频语义或依赖粗糙的融合策略,导致多模态表征次优。我们提出了 GAIS,一个从表征和正则化两个角度强化多模态对齐的检索框架。首先,引入帧级门控融合 (FGF) 模块,在文本指导下自适应集成音视频特征,实现对信息帧的细粒度时序选择。其次,引入语义方差缩放扰动 (SVSP) 机制,通过控制语义感知方式的扰动幅度来正则化文本嵌入空间。这两个模块相辅相成:FGF 通过选择性融合缩小模态差距,而 SVSP 改进嵌入的稳定性和判别性。广泛实验表明,GAIS 在 MSR-VTT、DiDeMo、LSMDC 和 VATEX 上的多个检索指标上均显著优于强基准模型,同时保持显著的计算效率。
引用
@article{arxiv.2508.01711,
title = {GAIS: Frame-Level Gated Audio-Visual Integration with Semantic Variance-Scaled Perturbation for Text-Video Retrieval},
author = {Bowen Yang and Yun Cao and Chen He and Xiaosu Su},
journal= {arXiv preprint arXiv:2508.01711},
year = {2025}
}
备注
13 pages