使用来自AI反馈的强化学习调优视频大型多模态模型
计算机视觉与模式识别
2024-06-18 v3
摘要
最近大型语言模型的进展影响了视频大型多模态模型(VLMMs)的发展。之前的方法包括监督微调(SFT)、将LLM与视觉编码器集成、添加额外可学习模块。视频和文本多模态对齐仍然具有挑战性,主要因为多模态指令调优数据的数量和质量低于纯文本数据。我们提出一种新的对齐策略,使用多模态AI系统自我监督,称为来自AI反馈的强化学习(RLAIF),提供自我偏好反馈以自我改进,促进视频和文本模态的对齐。具体地,我们提出上下文感知奖励建模,通过在生成偏好反馈时提供详细的视频描述作为上下文,以丰富对视频内容的理解。我们的多模态RLAIF方法VLM-RLAIF在多种视频基准上展示了增强的性能,优于现有方法,包括SFT模型。我们承诺开源代码、模型和数据集以促进该领域的进一步研究。
引用
@article{arxiv.2402.03746,
title = {Tuning Large Multimodal Models for Videos using Reinforcement Learning from AI Feedback},
author = {Daechul Ahn and Yura Choi and Youngjae Yu and Dongyeop Kang and Jonghyun Choi},
journal= {arXiv preprint arXiv:2402.03746},
year = {2024}
}
备注
ACL 2024