视频时序定位的多尺度对比学习
计算机视觉与模式识别
2026-04-28 v3
摘要
时序定位,即定位与自然语言查询相关的视频片段,是视觉语言学习和视频理解的核心问题。为了编码不同长度的视频片段,近期方法采用称为特征金字塔的多级结构。在该结构中,低层聚焦于短距离视频片段,而高层处理长距离片段。由于高层经历下采样以适应不断增长的片段长度,其捕获信息的能力降低,从而导致片段表示中的信息退化。为解决此问题,我们提出了一种对比学习框架,用于捕获视频片段中的显著语义。我们的关键方法论是利用来自视频编码器本身多个阶段的特征空间中的样本,无需数据增强或在线记忆库即可获取正样本和负样本。为实现这种扩展,我们引入了一种采样过程,以绘制与公共查询对应的多个视频片段。随后,通过利用这些片段在视频编码器各层中的表示,我们实现了一种新颖的多尺度和跨尺度对比学习,将局部短距离视频片段与全局长距离视频片段联系起来。大量实验证明了我们框架在长视频和短视频定位中的有效性。代码可在 https://github.com/nguyentthong/MSCL 获取。
引用
@article{arxiv.2412.07157,
title = {Multi-Scale Contrastive Learning for Video Temporal Grounding},
author = {Thong Thanh Nguyen and Yi Bin and Xiaobao Wu and Zhiyuan Hu and Cong-Duy T Nguyen and See-Kiong Ng and Anh Tuan Luu},
journal= {arXiv preprint arXiv:2412.07157},
year = {2026}
}
备注
Accepted at AAAI 2025