中文

VideoSAVi:无需人类监督的自对齐视频语言模型

计算机视觉与模式识别 2025-08-12 v3

摘要

近期视频大语言模型 (Video-LLM) 的进展推动了视频理解的显著进步。当前偏好优化方法通常依赖专有 API 或人工标注的标题生成偏好数据(即由质量或与人类判断一致性排序的模型输出),然后用于训练实现视频语言对齐的模型。这种方法既昂贵又耗费人力。为此,我们引入了 VideoSAVi (Self-Aligned Video Language Model),一个自训练管道,使 Video-LLM 能从视频内容中自主学习,而无需外部监督。我们的方法包括自批判机制,识别模型初始响应中的推理错误并生成改进后的备选方案,从而直接从视频内容创建偏好对。VideoSAVi 然后应用直接偏好优化 (Direct Preference Optimization, DPO) 来迭代训练模型,提高其对视频理解中时空推理能力。实验表明,VideoSAVi 在多个基准测试上实现了显著提升,包括在 MVBench 上提升 4.2 个百分点,在 PerceptionTest 上提升 3.9 个百分点,在具有挑战性的 EgoSchema 数据集上提升 6.8 个百分点。我们的方法具有模型中立性,仅需 32 帧,为无需依赖外部模型或标注的自对齐视频理解提供了有前景的方向。

关键词

引用

@article{arxiv.2412.00624,
  title  = {VideoSAVi: Self-Aligned Video Language Models without Human Supervision},
  author = {Yogesh Kulkarni and Pooyan Fazli},
  journal= {arXiv preprint arXiv:2412.00624},
  year   = {2025}
}

备注

COLM 2025