中文

video-SALMONN-o1:推理增强的音视频大语言模型

计算机视觉与模式识别 2025-02-18 v1

摘要

尽管近期在推理优化方面的进展显著提升了大语言模型 (LLM) 的能力,但现有的推理改进工作局限于求解数学问题和关注视觉图形输入,忽略了在通用视频理解中的更广泛应用。本文提出了 video-SALMONN-o1,这是第一个专为通用视频理解任务设计的开源推理增强音视频 LLM。为了增强其推理能力,我们开发了一个推理密集型数据集,其中包含具有挑战性的音视频问题和分步解答。我们还提出了过程直接偏好优化,该方法利用对比步骤选择来实现专为多模态输入量身定制的高效步骤级奖励建模。此外,我们引入了 RivaBench,这是第一个推理密集型视频理解基准,包含超过 4,000 对高质量、专家策划的问答对,涵盖单口喜剧、学术报告和合成视频检测等场景。在不同的视频推理基准上,video-SALMONN-o1 比 LLaVA-OneVision 基线实现了 3-8% 的准确率提升。此外,在 RivaBench 上,pDPO 与监督微调模型相比实现了 6-8% 的提升。增强的推理能力使 video-SALMONN-o1 具备了零样本合成视频检测能力。

关键词

引用

@article{arxiv.2502.11775,
  title  = {video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model},
  author = {Guangzhi Sun and Yudong Yang and Jimin Zhuang and Changli Tang and Yixuan Li and Wei Li and Zejun MA and Chao Zhang},
  journal= {arXiv preprint arXiv:2502.11775},
  year   = {2025}
}