通过瓶颈语义增量重新平衡文本-视频检索中的对比对齐
计算机视觉与模式识别
2025-10-24 v5 信息检索
多媒体
摘要
最近的文本-视频检索进展主要依赖对比学习。然而,现有方法常忽视模态间隙的影响,导致锚表示征发生原位优化 (即优化张力),限制了其对齐能力。此外,噪声硬负样本进一步扭曲锚点的语义。为解决这些问题,我们提出了 GARE,即 Gap-Aware Retrieval framework(基于间隙感知的检索框架),引入可学习的、特定于对的增量 ,用于在文本 和视频 之间重新分配梯度,以缓解优化张力并吸收噪声。我们通过对 InfoNCE 损失进行多变量一阶 Taylor 展开,并在信任区域约束下派生 ,表明其沿局部一致的下降方向引导更新。一个轻量级神经模块根据语义间隙对增量在 batch 级别进行耦合,以实现结构感知的纠正。此外,我们通过变分信息瓶颈进行 的正则化,采用放宽压缩,提高了稳定性和语义一致性。在四个基准数据集上的实验表明,GARE 在对齐精度和鲁棒性方面 consistently 提升,验证了间隙感知张力缓解的有效性。代码已公开于 https://github.com/musicman217/GARE-text-video-retrieval。
引用
@article{arxiv.2505.12499,
title = {Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval},
author = {Jian Xiao and Zijie Song and Jialong Hu and Hao Cheng and Jia Li and Zhenzhen Hu and Richang Hong},
journal= {arXiv preprint arXiv:2505.12499},
year = {2025}
}