中文

LPOI:视觉语言模型的列表式偏好优化

计算机视觉与模式识别 2025-05-28 v1 人工智能

摘要

将大型视觉语言模型(VLM)与人类偏好对齐是一项具有挑战性的任务,因为诸如 RLHF 和 DPO 等方法通常会过拟合文本信息或加剧幻觉。尽管增加负样本图像部分地解决了这些缺陷,但由于构建列表式图像样本的复杂性和成本,此前没有工作对 VLM 采用列表式偏好优化。在本工作中,我们提出了 LPOI,这是首个为减少 VLM 中的幻觉而开发的具有对象感知的列表式偏好优化方法。LPOI 识别并掩蔽图像中的关键对象,然后在正负图像之间对掩蔽区域进行插值,以形成一系列逐渐完整的图像。模型被训练以按对象可见性的升序对这些图像进行排序,在保持视觉保真度的同时有效减少幻觉。LPOI 除了标准的成对偏好数据外不需要额外的标注,因为它通过对象掩蔽和插值自动构建排序列表。在 MMHalBench、AMBER 和 Object HalBench 上的综合实验证实,LPOI 在减少幻觉和增强 VLM 性能方面优于现有的偏好优化方法。我们在 https://github.com/fatemehpesaran310/lpoi 提供了代码。

关键词

引用

@article{arxiv.2505.21061,
  title  = {LPOI: Listwise Preference Optimization for Vision Language Models},
  author = {Fatemeh Pesaran Zadeh and Yoojin Oh and Gunhee Kim},
  journal= {arXiv preprint arXiv:2505.21061},
  year   = {2025}
}

备注

ACL 2025 Main. Code is released at https://github.com/fatemehpesaran310/lpoi