通过面向幻觉的直接偏好优化缓解多模态大语言模型中的幻觉
计算与语言
2024-11-18 v1 人工智能
计算机视觉与模式识别
多媒体
摘要
多模态大语言模型(MLLMs)已知存在幻觉问题,这限制了它们的实际应用。近期工作尝试应用直接偏好优化(DPO)来提升MLLMs的性能,但在缓解幻觉方面表现出不一致的改进。为更有效地解决这一问题,我们引入了面向幻觉的直接偏好优化(HDPO)以减少MLLMs中的幻觉。与以往方法不同,我们的方法从幻觉的多种形式和成因入手。具体而言,我们开发了三类偏好对数据,分别针对MLLM幻觉的以下成因:(1)视觉能力不足,(2)长上下文生成,(3)多模态冲突。实验结果表明,我们的方法在多个幻觉评估数据集上取得了优越性能,超越了大多数最先进(SOTA)方法,凸显了我们方法的潜力。消融实验和深入分析进一步证实了我们方法的有效性,并表明通过规模扩大仍有进一步提升的潜力。
引用
@article{arxiv.2411.10436,
title = {Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimization},
author = {Yuhan Fu and Ruobing Xie and Xingwu Sun and Zhanhui Kang and Xirong Li},
journal= {arXiv preprint arXiv:2411.10436},
year = {2024}
}