中文

面向时序定位视频-语言模型的因子化学习

计算机视觉与模式识别 2026-01-01 v1 人工智能 计算与语言 多媒体

摘要

近期的视频-语言模型在视频理解方面展现出巨大潜力,但在事件级感知的精确时序定位上仍面临困难。我们观察到,视频理解中的两个主要因素(即时序定位与文本响应)形成了一个逻辑层次结构:精确的时序证据定位为可靠的文本响应奠定了基础。然而,现有工作通常以耦合方式处理这两个任务,缺乏清晰的逻辑结构,导致目标次优。我们从因子化学习的角度来解决这一问题。我们首先提出 D2^2VLM 框架,该框架解耦了这两个任务的学习,同时强调它们固有的依赖性。我们采用“先定位后基于证据引用回答”的范式,并引入证据令牌(evidence tokens)用于证据定位,这强调了超越现有工作中对时间戳表示关注的事件级视觉语义捕获。为了进一步促进这两个任务的学习,我们引入了一种新颖的因子化偏好优化(Factorized Preference Optimization, FPO)算法。与标准偏好优化不同,FPO 显式地将概率时序定位建模纳入优化目标,从而能够同时对时序定位和文本响应进行偏好学习。我们还构建了一个合成数据集,以解决缺乏适用于具有显式时序定位的因子化偏好学习的合适数据集的问题。在多种任务上的实验证明了我们方法的明显优势。我们的源代码可在 https://github.com/nusnlp/d2vlm 获取。

关键词

引用

@article{arxiv.2512.24097,
  title  = {Factorized Learning for Temporally Grounded Video-Language Models},
  author = {Wenzheng Zeng and Difei Gao and Mike Zheng Shou and Hwee Tou Ng},
  journal= {arXiv preprint arXiv:2512.24097},
  year   = {2026}
}

备注

ICCV 2025 paper. This arXiv version updates Figure 1 to include the concurrent work Qwen2.5-VL to ensure consistency with Table 1