中文

T2VLAD:用于文本-视频检索的全局-局部序列对齐

计算机视觉与模式识别 2021-04-21 v1 多媒体

摘要

文本-视频检索是一项具有挑战性的任务,旨在基于自然语言描述搜索相关的视频内容。该问题的关键是在联合嵌入空间中度量文本与视频的相似度。然而,大多数现有方法仅考虑全局跨模态相似度而忽略了局部细节。一些工作通过跨模态局部匹配与推理来引入局部比较,这些复杂操作带来了巨大的计算量。本文设计了一种高效的全局-局部对齐方法。多模态视频序列与文本特征通过一组共享语义中心进行自适应聚合。局部跨模态相似度在同一中心内的视频特征与文本特征之间计算。该设计实现了精细的局部比较,并降低了每一对文本-视频交互的计算代价。此外,提出了一种全局对齐方法,提供与局部视角互补的全局跨模态度量。全局聚合的视觉特征还提供了额外的监督,这对于可学习语义中心的优化是不可或缺的。我们在三个标准文本-视频检索基准上取得了持续的提升,并以明显优势超越了SOTA。

关键词

引用

@article{arxiv.2104.10054,
  title  = {T2VLAD: Global-Local Sequence Alignment for Text-Video Retrieval},
  author = {Xiaohan Wang and Linchao Zhu and Yi Yang},
  journal= {arXiv preprint arXiv:2104.10054},
  year   = {2021}
}

备注

Accepted to CVPR 2021