中文

通过对象感知偏好优化消除多模态 LLM 中的幻觉

计算机视觉与模式识别 2025-08-29 v1 人工智能 计算与语言 多媒体

摘要

多模态大语言模型 (MLLM) 作为解决从 NLP 到计算机视觉等多种任务的统一接口。尽管在许多基准测试中展示了最先进的结果,但仍存在一个长期问题,即 MLLM 倾向于生成不反映视觉输入中内容的答案,即幻觉。本文将幻觉视为一个对齐问题,旨在引导 MLLM 偏好生成无幻觉内容。与最近需要复杂管道为对齐训练构建合成偏好数据的不同方法(常常依赖专有模型)相比,我们利用众所周知的 CHAIR 指标(最初用于衡量图像描述中幻觉的程度)。给定一个生成答案的对,我们利用 CHAIR 来区分获胜者和败者选项(即非幻觉样本和幻觉样本),并通过直接偏好优化 (DPO) 对即插即用的 MLLM 进行微调。我们称之为 CHAIR-DPO 的 resulting 方法有效降低了多个幻觉基准测试中幻觉答案的数量,展示了使用 CHAIR 基于奖励的微调 MLLM 有效性。源代码和训练好的模型均可公开获取,地址为 https://github.com/aimagelab/CHAIR-DPO。

关键词

引用

@article{arxiv.2508.20181,
  title  = {Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization},
  author = {Alberto Compagnoni and Davide Caffagni and Nicholas Moratelli and Lorenzo Baraldi and Marcella Cornia and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2508.20181},
  year   = {2025}
}

备注

BMVC 2025