中文

基于多轮偏好优化提升多模态大语言模型以实现视频字幕的详细与准确

计算机视觉与模式识别 2024-10-14 v2 计算与语言 图像与视频处理

摘要

视频包含丰富的信息,生成自然语言中的详细且准确的描述是视频理解的关键方面。本文提出了 video-SALMONN 2,即一种针对通过定向偏好优化 (DPO) 实现增强视频(伴随配套音频)字幕的高级音视频大语言模型 (LLM),其采用低秩适应 (LoRA)。我们提出了新的指标来评估视频描述的完整性和准确性,并通过 DPO 对其进行优化。为进一步提高训练效果,我们引入一种新颖的多轮 DPO (mrDPO) 方法,该方法涉及定期更新 DPO 参考模型、在每个训练轮次(1000 步)后合并并重新初始化 LoRA 模块作为参数更新的代理,并纳入来自真实视频字幕的指导以稳定过程。为解决由于 mrDPO 导致非字幕能力潜在性遗忘的问题,我们提出了复活调谐 (rebirth tuning),即通过使用 mrDPO 训练模型生成的字幕作为监督标签来微调 mrDPO 之前的 LLM。实验表明,mrDPO显著增强了 video-SALMONN 2的字幕准确性,分别将全局错误率和局部错误率降低了40%和20%,重复率下降35%。最终的 video-SALMONN 2模型仅需7亿参数,便在视频字幕任务中超越了GPT-4o和Gemini-1.5-Pro等领先模型,同时在规模相似的模型中保持对广泛使用的视频问答基准的竞争性能。接受录取后,我们将发布代码、模型检查点以及训练和测试数据。演示可在 \href{https://video-salmonn-2.github.io}{https://video-salmonn-2.github.io} 查看。

关键词

引用

@article{arxiv.2410.06682,
  title  = {Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization},
  author = {Changli Tang and Yixuan Li and Yudong Yang and Jimin Zhuang and Guangzhi Sun and Wei Li and Zujun Ma and Chao Zhang},
  journal= {arXiv preprint arXiv:2410.06682},
  year   = {2024}
}