中文

长形式视频理解的时间偏好优化

计算机视觉与模式识别 2025-09-03 v3 人工智能 计算与语言 机器学习 机器人学

摘要

尽管视频大型多模态模型 (video-LMM) 在显著取得了进展,但在长视频中的有效时间定位仍是现有模型的挑战。为此,我们提出时间偏好优化 (Temporal Preference Optimization, TPO),一种新型后训练框架,旨在通过偏好学习提升 video-LMM 的时间定位能力。TPO 采用自训练方法,使模型能通过利用两个层次 Granularity 的精选偏好数据集区分不同程度的时间响应:局部时间定位聚焦于特定视频片段,综合时间定位捕捉整个视频序列中的扩展时间依赖性。通过在这些偏好数据集上优化,TPO 在降低对手动标注数据的依赖方面显著提升了时间理解能力。针对三个长形式视频理解基准——LongVideoBench、MLVU 和 Video-MME——进行大规模实验,表明 TPO 在两种最先进的 video-LMM 上均有效。值得注意的是,LLaVA-Video-TPO 在 Video-MME 基准上建立了该领域 7B 参数模型中的领先地位,凸显了 TPO 作为提升长形式视频理解中时间推理能力的可扩展且高效解决方案的潜力。项目页面: https://ruili33.github.io/tpo_website

关键词

引用

@article{arxiv.2501.13919,
  title  = {Temporal Preference Optimization for Long-Form Video Understanding},
  author = {Rui Li and Xiaohan Wang and Yuhui Zhang and Orr Zohar and Zeyu Wang and Serena Yeung-Levy},
  journal= {arXiv preprint arXiv:2501.13919},
  year   = {2025}
}