中文

OViP:面向 VLM 幻觉的在线视觉语言偏好学习

计算机视觉与模式识别 2025-09-30 v2 计算与语言

摘要

大型视觉语言模型 (LVLMs) 仍然容易产生幻觉,常常生成与视觉输入不一致的内容。虽然最近的基于训练的方法旨在缓解幻觉问题,但它们通常依赖于预定义或随机编辑的负面样本,这些样本不反映实际的模型错误,从而限制了训练的有效性。本文提出了一种在线视觉语言偏好学习 (OViP) 框架,通过基于模型自身幻觉输出动态构建对抗性训练数据。通过识别样本响应对之间的语义差异,并使用扩散模型合成负面图像,OViP 实时生成更相关的监督信号。这种以失败为导向的训练使模型能够适应性地对齐文本和视觉偏好。此外,我们改进了现有的评估协议,以更好地捕捉幻觉抑制与表达能力之间的权衡。在幻觉和通用基准测试上的实验表明,OViP 不仅在保持核心多模态能力的同时显著减少幻觉,还大幅提高了训练效率。代码已提供于 https://github.com/lsjlsj35/Online-Vision-Language-Preference-Learning-for-VLM-Hallucination。

关键词

引用

@article{arxiv.2505.15963,
  title  = {OViP: Online Vision-Language Preference Learning for VLM Hallucination},
  author = {Shujun Liu and Siyuan Wang and Zejun Li and Jianxiang Wang and Cheng Zeng and Zhongyu Wei},
  journal= {arXiv preprint arXiv:2505.15963},
  year   = {2025}
}