Oracle-RLAIF:通过排序反馈强化学习改进多模态视频模型的微调框架
计算机视觉与模式识别
2025-10-06 v1 人工智能
摘要
近期大型视频语言模型(VLMs)的进展依赖于广泛的微调技术,以加强文本与视觉理解之间的对齐。主流流程通常将监督微调(SFT)与基于偏好数据的强化学习相结合,以增强视频理解。然而,随着VLMs的参数规模增大,收集足够的人类反馈的成本也随之增加。为了使微调更具成本效益,近期的框架探索了基于AI反馈的强化学习(RLAIF),用AI替代人类作为评判者。现有的RLAIF框架依赖于使用视频叙事训练的专用奖励模型来创建校准的标量奖励——这是一个昂贵且受限的流程。我们提出了Oracle-RLAIF,一种新颖的框架,用更通用的Oracle排序器替代训练好的奖励模型,该排序器作为即插即用模型对候选模型响应进行排序而非评分。与Oracle-RLAIF一同,我们引入了,一种基于组相对策略优化(GRPO)的新型基于排序的损失函数,直接利用排序感知的优势优化序数反馈。经验上,我们证明Oracle-RLAIF在各种视频理解基准测试中始终优于使用现有微调方法的领先VLMs。Oracle-RLAIF为通过排序而非评分的强化学习来对齐大型多模态视频模型铺平了道路,创建灵活且数据高效的框架。
引用
@article{arxiv.2510.02561,
title = {Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models through Reinforcement Learning from Ranking Feedback},
author = {Derek Shi and Ruben Glatt and Christine Klymko and Shubham Mohole and Hongjun Choi and Shashank Kushwaha and Sam Sakla and Felipe Leno da Silva},
journal= {arXiv preprint arXiv:2510.02561},
year = {2025}
}
备注
Proceedings of the 39th Annual Conference on Neural Information Processing Systems, ARLET Workshop (Aligning Reinforcement Learning Experimentalists and Theorists)