中文

video-SALMONN 2:带标题增强的音视频大语言模型

计算机视觉与模式识别 2025-09-29 v3 计算与语言 声音

摘要

我们提出了 video-SALMONN 2,一套音视频大语言模型,在视频描述和问答(QA)任务中取得了新的最先进(SOTA)结果。我们的核心贡献是多轮直接偏好优化(MrDPO),搭配一种caption-quality目标,联合奖励完整性和事实准确性。与标准DPO不同,后者使用固定的参考策略;而MrDPO定期通过从新重新初始化的轻量级适配器训练获得最新偏好来刷新参考方案,避免参考效应 stale,实现持续改进。该策略产生的描述在细节和准确性上均优于如 GPT-4o 和 Gemini-1.5 Pro 等专有系统。我们进一步通过利用模型生成高质量视频-标题语料库进行监督式微调,将这些收益传递给复杂视频-QA 任务,实现卓越的表现。在广泛使用的音视频和视觉理解基准测试(包括 Video-MME、WorldSense、AVUT、Video-Holmes、DailyOmni、MLVU 和 LVBench)上,我们的 3B 和 7B 模型在相当规模下实现 SOTA 结果,而 72B 模型超越了所有其他开源系统。我们的源代码、模型和数据已发布于 \href{https://github.com/bytedance/video-SALMONN-2}{https://github.com/bytedance/video-SALMONN-2}。

关键词

引用

@article{arxiv.2506.15220,
  title  = {video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models},
  author = {Changli Tang and Yixuan Li and Yudong Yang and Jimin Zhuang and Guangzhi Sun and Wei Li and Zejun Ma and Chao Zhang},
  journal= {arXiv preprint arXiv:2506.15220},
  year   = {2025}
}