X-CLIP: 用于视频-文本检索的端到端多粒度对比学习
计算机视觉与模式识别
2022-09-23 v2
摘要
视频-文本检索是多模态研究中一项关键且基础的任务。大规模多模态对比预训练显著推动了视频-文本检索的发展,其主要关注粗粒度或细粒度对比。然而,跨粒度对比——即粗粒度表示与细粒度表示之间的对比——在以往研究中鲜有探索。相较于细粒度或粗粒度对比,跨粒度对比计算粗粒度特征与各个细粒度特征之间的相关性,并能在相似度计算过程中于粗粒度特征引导下过滤掉不必要的细粒度特征,从而提升检索准确率。为此,本文提出一种新颖的多粒度对比模型,即 X-CLIP,用于视频-文本检索。然而,另一挑战在于相似度聚合问题,其旨在将细粒度与跨粒度相似度矩阵聚合为实例级相似度。为应对该挑战,我们提出相似度矩阵上的注意力(AOSM)模块,使模型聚焦于关键帧与词之间的对比,从而降低不必要帧与词对检索结果的影响。借助多粒度对比与所提 AOSM 模块,X-CLIP 在五个广泛使用的视频-文本检索数据集上取得优异性能,包括 MSR-VTT (49.3 R@1)、MSVD (50.4 R@1)、LSMDC (26.1 R@1)、DiDeMo (47.8 R@1) 与 ActivityNet (46.2 R@1)。其在这些基准上相对先前最优(state-of-the-art)分别取得 +6.3%、+6.6%、+11.1%、+6.7%、+3.8% 的相对提升,展示了多粒度对比与 AOSM 的优越性。
引用
@article{arxiv.2207.07285,
title = {X-CLIP: End-to-End Multi-grained Contrastive Learning for Video-Text Retrieval},
author = {Yiwei Ma and Guohai Xu and Xiaoshuai Sun and Ming Yan and Ji Zhang and Rongrong Ji},
journal= {arXiv preprint arXiv:2207.07285},
year = {2022}
}
备注
13 pages, 6 figures, ACMMM22