RLAIF-V:开源 AI 反馈实现超越 GPT-4V 的可信度
计算与语言
2025-10-30 v3
摘要
传统的用于减少幻觉的反馈学习依赖于劳动密集型的人工标注或昂贵的专有模型。这使得社区缺乏关于如何利用开源多模态大语言模型 (MLLMs) 构建高质量反馈的基础知识。在这项工作中,我们引入了 RLAIF-V,这是一个在完全开源范式下对齐 MLLMs 的新颖框架。RLAIF-V 从两个角度最大限度地探索了开源 MLLMs,包括用于偏好学习的高质量反馈数据生成和用于推理时扩展的自反馈指导。在六个基准上的大量自动和人工评估实验表明,RLAIF-V 在偏好学习和推理阶段都显著增强了模型的可信度。RLAIF-V 7B 将对象幻觉减少了 80.7%,总体幻觉减少了 33.7%。值得注意的是,RLAIF-V 12B 进一步揭示了开源 MLLMs 的自对齐潜力,模型可以从自身的反馈中学习,从而实现超越 GPT-4V 的可信度。
引用
@article{arxiv.2405.17220,
title = {RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V Trustworthiness},
author = {Tianyu Yu and Haoye Zhang and Qiming Li and Qixin Xu and Yuan Yao and Da Chen and Xiaoman Lu and Ganqu Cui and Yunkai Dang and Taiwen He and Xiaocheng Feng and Jun Song and Bo Zheng and Zhiyuan Liu and Tat-Seng Chua and Maosong Sun},
journal= {arXiv preprint arXiv:2405.17220},
year = {2025}
}
备注
Project Website: https://github.com/RLHF-V/RLAIF-V