中文

AdaViP:通过自适应视觉增强偏好优化对齐多模态大语言模型

计算机视觉与模式识别 2025-04-23 v1

摘要

通过直接偏好优化(DPO)实现的偏好对齐在对 multimodal large language models(MLLMs)实现人类偏好方面显示出显著效果。然而,现有方法主要关注语言偏好,忽视了视觉上下文的关键作用。本文提出一种自适应视觉增强偏好优化(AdaViP),以解决这些局限性,其包含两个关键创新:(1) 基于视觉的偏好对构建,将整合多个视觉基础模型,战略性地从图像中移除关键视觉元素,以增强 MLLMs 对视觉细节的敏感性;(2) 自适应偏好优化,动态平衡视觉和语言偏好,以实现更精确的对齐。广泛的评估表明我们的方法有效。值得注意的是,AdaViP-7B 在 Object HalBench 上的响应级和被提及级幻觉分别降低了 93.7% 和 96.4%,显著优于当前最先进的方法。

关键词

引用

@article{arxiv.2504.15619,
  title  = {AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization},
  author = {Jinda Lu and Jinghan Li and Yuan Gao and Junkang Wu and Jiancan Wu and Xiang Wang and Xiangnan He},
  journal= {arXiv preprint arXiv:2504.15619},
  year   = {2025}
}