中文

使用视频查询对时间轴进行对齐

计算机视觉与模式识别 2025-09-03 v2

摘要

视频到视频时刻检索 (Vid2VidMR) 是使用查询视频在目标视频中定位未见事件或时刻的任务。这一任务面临诸多挑战,如需进行语义帧级对齐以及建模查询与目标视频之间的复杂依赖关系。为解决这一挑战性问题,我们提出了 MATR (Moment Alignment TRansformer),这是一种基于变换器的模型,旨在捕获语义上下文以及精确时刻定位所必需的时序细节。MATR 通过双阶段序列对齐将目标视频表示条件化于查询视频特征,以编码所需的相关性和依赖关系。随后,这些表示用于指导前景/背景分类和边界预测头,从而准确识别与查询视频在语义上匹配的目标视频中的时刻。此外,为提供 MATR 的强有力的任务特定初始化,我们提出了一种自监督预训练技术,即训练模型在视频中定位随机片段。广泛的实验表明,MATR 在 ActivityNet-VRL 数据集上相较于最先进的方法实现了 13.1% 的 R@1 提升和 8.1% 的 mIoU 提升。此外,在我们新提出的数据集 SportsMoments 上,MATR 在 R@1 上实现了 14.7% 的提升,在 mIoU 上实现了 14.4% 的提升。

关键词

引用

@article{arxiv.2508.15439,
  title  = {Aligning Moments in Time using Video Queries},
  author = {Yogesh Kumar and Uday Agarwal and Manish Gupta and Anand Mishra},
  journal= {arXiv preprint arXiv:2508.15439},
  year   = {2025}
}

备注

11 pages, 4 figures, accepted at ICCV 2025