中文

TEMPLE:通过渐进式预SFT对齐激励视频大语言模型的时间理解

计算机视觉与模式识别 2025-12-09 v4 人工智能

摘要

视频大语言模型(Video LLMs)通过大规模预训练后进行监督微调(SFT)范式取得了显著进展。然而,现有方法由于数据中时间对应性弱以及过度依赖下一词预测范式,难以处理时间推理问题,导致缺乏时间监督。为此,本文提出TEMPLE(TEMporal Preference LEarning),一个系统化框架,通过直接偏好优化(DPO)增强时间推理能力。为解决数据中时间信息稀缺的问题,本文引入一个自动化管道,通过三个步骤系统构建时间丰富的偏好对:选择时间丰富的视频、设计视频特定的扰动策略、评估干净输入和扰动输入上的模型响应。补充此数据管道,我们提供额外的监督信号通过偏好学习,并提出一种新的渐进式预SFT对齐策略,包含两个关键创新:一种逐步增加扰动难度的课程学习策略以最大化数据效率;以及在指令调优之前应用偏好优化以激励基本的时间对齐。大量实验表明,我们的方法在多个基准测试上 consistently 提供性能提升,仅需少量自生成的DPO数据。我们的发现表明TEMPLE作为SFT方法的可扩展且高效的补充,为开发可靠的视频大语言模型指明了方向。

关键词

引用

@article{arxiv.2503.16929,
  title  = {TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment},
  author = {Shicheng Li and Lei Li and Kun Ouyang and Shuhuai Ren and Yuanxin Liu and Yuanxing Zhang and Fuzheng Zhang and Lingpeng Kong and Qi Liu and Xu Sun},
  journal= {arXiv preprint arXiv:2503.16929},
  year   = {2025}
}

备注

Accepted to AAAI 2026. Code available at https://github.com/lscpku/TEMPLE