中文

基于时刻量化的视频时序定位

计算机视觉与模式识别 2025-04-04 v1

摘要

视频时序定位是视频理解中的关键任务,旨在定位与语言描述相关的时刻。该任务的挑战在于区分相关与不相关的时刻。以往方法关注学习连续特征,难以在前景和背景特征之间建立强烈的区分度。本文提出了一种新颖的时刻量化视频时序定位方法(MQVTG),通过对输入视频进行离散向量量化来增强相关时刻与不相关时刻之间的判别能力。具体而言,MQVTG维护一个可学习的时刻词汇表,其中每个视频时刻匹配一个词码。鉴于视觉多样性,即相同时刻的各种视觉表达,MQVTG将时刻-词码匹配视为一种聚类过程,无需使用离散向量,从而避免直接硬量化导致的有用信息丢失。此外,我们采用有效的先验初始化和联合投影策略来增强所维护的时刻词汇表。由于其简单实现,所提方法可作为插即用组件集成到现有的时序定位模型中。在六个流行基准数据集上的大量实验表明,MQVTG的有效性和通用性,显著优于最先进的方法。进一步的定性分析显示,我们的方法有效地对相关特征进行分组并分离无关特征,契合增强判别能力的目标。

关键词

引用

@article{arxiv.2504.02286,
  title  = {Moment Quantization for Video Temporal Grounding},
  author = {Xiaolong Sun and Le Wang and Sanping Zhou and Liushuai Shi and Kun Xia and Mengnan Liu and Yabing Wang and Gang Hua},
  journal= {arXiv preprint arXiv:2504.02286},
  year   = {2025}
}