中文

通过 DPO 缓解大型视觉语言模型中的幻觉:同策略数据是关键

计算机视觉与模式识别 2025-03-04 v2

摘要

幻觉仍然是大型视觉语言模型 面临的重大挑战。直接偏好优化 作为解决幻觉问题的一种简单方案,受到了越来越多的关注。它直接从构建的偏好对中学习,这些偏好对反映了对相同提示和图像的响应中幻觉的严重程度。尽管如此,现有工作中不同的数据构建方法带来了显著的性能差异。我们在此确定了一个关键因素:结果在很大程度上取决于构建的数据是否相对于 DPO 的初始(参考)策略在同策略 上对齐。理论分析表明,从非同策略 数据中学习受到更新策略与参考策略之间 KL 散度存在的阻碍。从数据集分布的角度,我们系统地总结了现有算法中采用 DPO 解决幻觉问题的固有缺陷。为了缓解这些问题,我们提出了同策略对齐 (OPA)-DPO 框架,该框架独特地利用专家反馈纠正幻觉响应,并以同策略方式对齐原始响应和专家修订后的响应。值得注意的是,仅需 4.8k 数据,OPA-DPO 在 LLaVA-1.5-7B 上实现了额外的幻觉率降低:与使用 16k 样本训练的先前 SOTA 算法相比,在 AMBER 基准上降低 13.26%,在 Object-Hal 基准上降低 5.39%。我们的实现可在 https://github.com/zhyang2226/OPA-DPO 获取。

关键词

引用

@article{arxiv.2501.09695,
  title  = {Mitigating Hallucinations in Large Vision-Language Models via DPO: On-Policy Data Hold the Key},
  author = {Zhihe Yang and Xufang Luo and Dongqi Han and Yunjian Xu and Dongsheng Li},
  journal= {arXiv preprint arXiv:2501.09695},
  year   = {2025}
}

备注

Accepted by CVPR 2025