RLHF-V: 通过细粒度纠错人类反馈的行为对齐实现可信多模态大语言模型
计算与语言
2024-03-11 v2 计算机视觉与模式识别
摘要
多模态大语言模型(MLLMs)近期在多模态理解、推理与交互方面展现出令人印象深刻的能力。然而,现有MLLMs普遍遭受严重的幻觉问题,生成与关联图像事实不符的文本。该问题使现有MLLMs不可信,从而难以在真实世界(尤其是高风险)应用中实用。为应对此挑战,我们提出RLHF-V,其通过来自细粒度纠错人类反馈的行为对齐来增强MLLM的可信度。具体而言,RLHF-V以针对幻觉的片段级纠正形式收集人类偏好,并基于人类反馈执行稠密直接偏好优化。在五个基准上进行的自动与人工综合评估表明,RLHF-V能够以可观的数据与计算效率实现显著更可信的MLLM行为。值得注意的是,使用1.4k标注数据样本,RLHF-V将基础MLLM的幻觉率显著降低34.8%,优于在10k标注数据上训练的同期LLaVA-RLHF。最终模型在开源MLLMs的可信度方面达到最先进性能,并展现出优于GPT-4V的防止由过度泛化引发幻觉的鲁棒性。我们在https://github.com/RLHF-V/RLHF-V开源代码、模型与数据。
引用
@article{arxiv.2312.00849,
title = {RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback},
author = {Tianyu Yu and Yuan Yao and Haoye Zhang and Taiwen He and Yifeng Han and Ganqu Cui and Jinyi Hu and Zhiyuan Liu and Hai-Tao Zheng and Maosong Sun and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2312.00849},
year = {2024}
}
备注
Accepted by CVPR 2024