中文

CHiP:面向多模态大语言模型的跨模态分层直接偏好优化

计算与语言 2025-01-29 v1 计算机视觉与模式识别

摘要

尽管多模态大语言模型(MLLMs)能力出众,但它们仍然存在幻觉问题。最近的研究尝试通过将直接偏好优化(DPO)应用于多模态场景,并使用基于文本响应的偏好对来缓解这一问题。然而,我们对表征分布的分析表明,多模态 DPO 难以对齐图像和文本表征,也难以区分幻觉描述与非幻觉描述。为了应对这些挑战,在本工作中,我们提出了跨模态分层直接偏好优化(CHiP)以解决这些局限性。我们在 DPO 框架内引入了一个视觉偏好优化模块,使 MLLMs 能够同时从文本和视觉偏好中学习。此外,我们提出了一个分层文本偏好优化模块,使模型能够在多个粒度级别(包括响应级、片段级和词元级)上捕获偏好。我们通过定量和定性分析对 CHiP 进行了评估,在多个基准测试上的结果表明其在减少幻觉方面的有效性。在 Object HalBench 数据集上,CHiP 在幻觉减少方面优于 DPO,基于 Muffin 和 LLaVA 基模型分别取得了 52.7% 和 55.5% 的相对提升。我们已将所有数据集和代码公开:https://github.com/LVUGAI/CHiP。

关键词

引用

@article{arxiv.2501.16629,
  title  = {CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs},
  author = {Jinlan Fu and Shenzhen Huangfu and Hao Fei and Xiaoyu Shen and Bryan Hooi and Xipeng Qiu and See-Kiong Ng},
  journal= {arXiv preprint arXiv:2501.16629},
  year   = {2025}
}

备注

Accepted by ICLR 2025