中文

X-Pool:用于文本-视频检索的跨模态语言-视频注意力

计算机视觉与模式识别 2022-03-30 v1

摘要

在文本-视频检索中,目标是学习文本与视频之间的跨模态相似度函数,将相关文本-视频对排在无关对之前。然而,视频本质上表达比文本广泛得多的信息。相反,文本常捕捉整个视频的子区域,并且在语义上最类似于视频中的某些帧。因此,对于给定的文本,检索模型应聚焦于文本在语义上最相似的视频子区域以进行更相关的比较。然而,大多数现有工作聚合整个视频而不直接考虑文本。常见的文本无关聚合方案包括帧上的均值池化或自注意力,但这些可能编码给定文本中未描述的误导性视觉信息。为此,我们提出一种称为 X-Pool 的跨模态注意力模型,在文本与视频帧之间进行推理。我们的核心机制是文本对其语义最相似帧的缩放点积注意力。然后我们生成以文本在帧上的注意力权重为条件的聚合视频表示。我们在 MSR-VTT、MSVD 和 LSMDC 三个基准数据集上评估我们的方法,在 Recall@1 上取得高达 12% 相对提升的新最先进结果。我们的发现从而凸显了根据文本提取重要视觉线索的联合文本-视频推理的重要性。完整代码与演示见:https://layer6ai-labs.github.io/xpool/

关键词

引用

@article{arxiv.2203.15086,
  title  = {X-Pool: Cross-Modal Language-Video Attention for Text-Video Retrieval},
  author = {Satya Krishna Gorti and Noel Vouitsis and Junwei Ma and Keyvan Golestan and Maksims Volkovs and Animesh Garg and Guangwei Yu},
  journal= {arXiv preprint arXiv:2203.15086},
  year   = {2022}
}

备注

CVPR 2022