中文

面向可泛化视频时刻检索:将视觉动态注入图像-文本预训练

计算机视觉与模式识别 2023-03-27 v2

摘要

视觉与文本之间的关联对视频时刻检索(VMR)至关重要,然而现有方法严重依赖独立的预训练特征提取器来进行视觉与文本理解。在没有充足时间边界标注的情况下,学习通用的视频-文本对齐并非易事。本工作中,我们探索从大规模图像-文本数据中导出的多模态关联,以促进可泛化的VMR。为解决图像-文本预训练模型在捕捉视频变化方面的局限,我们提出一种通用方法,称为视觉动态注入(VDI),以增强模型对视频时刻的理解。尽管现有VMR方法聚焦于构建时序感知的视频特征,但感知关于时序变化的文本描述同样关键,却在以静态图像匹配句子的预训练中原本被忽视。因此,我们从视频帧中提取视觉上下文与空间动态信息,并显式强制其与描述视频变化的短语(如动词)对齐。如此一来,视频中潜在相关的视觉与运动模式被编码进相应的文本嵌入中(即被注入),从而实现更精准的视频-文本对齐。我们在两个VMR基准数据集(Charades-STA与ActivityNet-Captions)上进行了充分实验,取得了最先进的性能。特别地,VDI在分布外划分上测试时(测试样本涉及新场景与词汇)展现出显著优势。

关键词

引用

@article{arxiv.2303.00040,
  title  = {Towards Generalisable Video Moment Retrieval: Visual-Dynamic Injection to Image-Text Pre-Training},
  author = {Dezhao Luo and Jiabo Huang and Shaogang Gong and Hailin Jin and Yang Liu},
  journal= {arXiv preprint arXiv:2303.00040},
  year   = {2023}
}

备注

CVPR2023