用事实增强的RLHF对齐大语言多模态模型
计算机视觉与模式识别
2023-09-27 v1 计算与语言
摘要
大语言多模态模型(LMM)跨模态构建,而两模态间的错位会导致“幻觉”,即生成未被上下文中多模态信息所支撑的文本输出。为解决多模态错位问题,我们将文本领域的基于人类反馈的强化学习(RLHF)适配到视觉-语言对齐任务中:让人类标注者比较两份回复并指出幻觉更严重者,并训练视觉-语言模型以最大化模拟人类奖励。我们提出一种称为事实增强RLHF的新对齐算法,用图像描述与真值多选选项等附加事实信息增强奖励模型,缓解了RLHF中的奖励黑客现象并进一步提升性能。我们还用已有的人类撰写图文对增强GPT-4生成的训练数据(用于视觉指令微调),以提升模型通用能力。为在真实场景中评估所提方法,我们开发了重点关注惩罚幻觉的新评测基准MMHAL-BENCH。作为首个用RLHF训练的LMM,我们的方法在LLaVA-Bench数据集上取得显著提升,达到纯文本GPT-4的94%性能水平(此前最佳方法仅达87%),且在MMHAL-BENCH上比其他基线提升60%。我们在 https://llava-rlhf.github.io 开源代码、模型与数据。
引用
@article{arxiv.2309.14525,
title = {Aligning Large Multimodal Models with Factually Augmented RLHF},
author = {Zhiqing Sun and Sheng Shen and Shengcao Cao and Haotian Liu and Chunyuan Li and Yikang Shen and Chuang Gan and Liang-Yan Gui and Yu-Xiong Wang and Yiming Yang and Kurt Keutzer and Trevor Darrell},
journal= {arXiv preprint arXiv:2309.14525},
year = {2023}
}
备注
Preprint