中文

Hybrid-Tower:用于文本到视频检索的细粒度伪查询交互与生成

计算机视觉与模式识别 2025-09-08 v1

摘要

文本到视频检索(T2VR)任务旨在通过具有相同语义的文本查询检索未标记视频。近期基于 CLIP 的方法探索了两种框架:双塔框架与单塔框架,但前者有效性低,而后者效率低。在本研究中,我们探索了一种新的 Hybrid-Tower 框架,该框架能够融合双塔和单塔框架的优势,同时实现高有效性和高效率。我们提出了一种新颖的混合方法,即用于 T2VR 的细粒度伪查询交互与生成(PIG),该方法包含一个新的伪查询生成器,旨在为每个视频生成一个伪查询。这使得视频特征和伪查询的文本特征能够以细粒度的方式进行交互,类似于单塔方法以保持高有效性,甚至在接收到真实文本查询之前即可实现。同时,与双塔框架相比,我们的方法在推理阶段没有引入额外的存储或计算开销,从而保持了高效率。在五个常用的文本到视频检索基准上的大量实验表明,我们的方法在基线上取得了显著提升,R@1 提高了 1.6%3.9%1.6\% \sim 3.9\%。此外,我们的方法在匹配双塔模型效率的同时,实现了接近最先进的性能,突显了 Hybrid-Tower 框架的优势。

关键词

引用

@article{arxiv.2509.04773,
  title  = {Hybrid-Tower: Fine-grained Pseudo-query Interaction and Generation for Text-to-Video Retrieval},
  author = {Bangxiang Lan and Ruobing Xie and Ruixiang Zhao and Xingwu Sun and Zhanhui Kang and Gang Yang and Xirong Li},
  journal= {arXiv preprint arXiv:2509.04773},
  year   = {2025}
}

备注

Accepted to ICCV2025