中文

全局-局部语义一致性学习的文本-视频检索

计算机视觉与模式识别 2024-07-17 v3

摘要

将大规模图像-文本预训练模型(如CLIP)适配到视频领域是当前文本-视频检索的最先进技术。主要方法涉及将文本-视频对映射到公共嵌入空间,并利用特定实体上的跨模态交互进行语义对齐。虽然有效,但这些范式需要高昂的计算成本,导致检索效率低下。为了解决这个问题,我们提出了一种简单而有效的方法,即全局-局部语义一致性学习(GLSCL),它利用跨模态的潜在共享语义进行文本-视频检索。具体来说,我们引入了一个无参数的全局交互模块来探索粗粒度对齐。然后,我们设计了一个共享的局部交互模块,该模块采用几个可学习的查询来捕获潜在语义概念,以学习细粒度对齐。此外,我们设计了间一致性损失(ICL)来实现视觉查询和相应文本查询之间的概念对齐,并开发了内多样性损失(IDL)来排斥视觉(文本)查询内的分布,以生成更具判别性的概念。在五个广泛使用的基准(即MSR-VTT、MSVD、DiDeMo、LSMDC和ActivityNet)上进行的大量实验证明了所提出方法的优越有效性和效率。值得注意的是,我们的方法实现了与SOTA相当的性能,同时计算成本几乎快了220倍。代码可在https://github.com/zchoi/GLSCL获取。

关键词

引用

@article{arxiv.2405.12710,
  title  = {Text-Video Retrieval with Global-Local Semantic Consistent Learning},
  author = {Haonan Zhang and Pengpeng Zeng and Lianli Gao and Jingkuan Song and Yihang Duan and Xinyu Lyu and Hengtao Shen},
  journal= {arXiv preprint arXiv:2405.12710},
  year   = {2024}
}

备注

The author has withdrawn this paper due to a critical definitional error in concept learning for global/local-interaction learning during training. This error led to an alignment issue with the definition of the text-video retrieval task, causing an unfair comparison with state-of-the-art (SOTA) methods. Consequently, this hindered the accurate evaluation of the paper's contributions