中文

面向视频文本检索的多尺度时序差异变换器

计算机视觉与模式识别 2024-06-25 v1 人工智能

摘要

目前,在视频文本检索领域,许多基于变换器的方法。它们通常将帧特征堆叠并重新将帧作为标记使用,然后使用变换器进行视频时序建模。然而,这些方法常常忽视变换器在建模局部时序信息方面的局限能力。为解决这一问题,我们提出一种名为多尺度时序差异变换器(MSTDT)的变换器变体。MSTDT主要针对传统变换器在捕获局部时序信息方面有限能力的缺陷进行改进。此外,为了更好地建模详细的动态信息,我们利用帧之间的差分特征,这在实践中实际反映了视频的动态运动。我们提取帧间差分特征并通过多尺度时序变换器将差分特征和帧特征集成。总体而言,我们提出的MSTDT由短期多尺度时序差异变换器和长期时序变换器组成。前者专注于建模局部时序信息,后者旨在建模全局时序信息。最后,我们提出一种新的损失函数以缩小相似样本的距离。大量实验表明,带有MSTDT的主干网络(如CLIP)已达到新的最先进成果。

关键词

引用

@article{arxiv.2406.16111,
  title  = {Multi-Scale Temporal Difference Transformer for Video-Text Retrieval},
  author = {Ni Wang and Dongliang Liao and Xing Xu},
  journal= {arXiv preprint arXiv:2406.16111},
  year   = {2024}
}