中文

使用来自AI反馈的强化学习调优视频大型多模态模型

计算机视觉与模式识别 2024-06-18 v3

摘要

最近大型语言模型的进展影响了视频大型多模态模型(VLMMs)的发展。之前的方法包括监督微调(SFT)、将LLM与视觉编码器集成、添加额外可学习模块。视频和文本多模态对齐仍然具有挑战性,主要因为多模态指令调优数据的数量和质量低于纯文本数据。我们提出一种新的对齐策略,使用多模态AI系统自我监督,称为来自AI反馈的强化学习(RLAIF),提供自我偏好反馈以自我改进,促进视频和文本模态的对齐。具体地,我们提出上下文感知奖励建模,通过在生成偏好反馈时提供详细的视频描述作为上下文,以丰富对视频内容的理解。我们的多模态RLAIF方法VLM-RLAIF在多种视频基准上展示了增强的性能,优于现有方法,包括SFT模型。我们承诺开源代码、模型和数据集以促进该领域的进一步研究。

关键词

引用

@article{arxiv.2402.03746,
  title  = {Tuning Large Multimodal Models for Videos using Reinforcement Learning from AI Feedback},
  author = {Daechul Ahn and Yura Choi and Youngjae Yu and Dongyeop Kang and Jonghyun Choi},
  journal= {arXiv preprint arXiv:2402.03746},
  year   = {2024}
}

备注

ACL 2024