通过自注入幻觉来缓解大型视觉语言模型中的幻觉问题
计算机视觉与模式识别
2025-09-16 v1 计算与语言
摘要
大型视觉语言模型 (LVLMs) 严重受到幻觉问题的影响,即模型生成的响应与视觉输入不一致。现有的幻觉缓解方法主要基于偏好对齐,需依赖外部人工标注或辅助模型收集偏好数据,这会增加成本并限制可持续的改进。为应对这些挑战,我们提出一种 novel 方法——自注入幻觉实现自主偏好对齐 (APASI),该方法无需外部依赖即可缓解幻觉问题。APASI 利用目标 LVM 自注入幻觉到生成的响应中,创建出幻觉程度不同的响应对。在自注入过程中,基于幻觉的三个关键观察结果生成次偏好响应,以确保其模拟真实的幻觉模式。这种保真度为幻觉缓解提供了准确的学习信号。此外,APASI 融合了迭代对齐训练策略结合课程学习,以定期更新具有日益增大的挑战性的偏好数据,实现稳定和持续的 LVLM 改进。广泛的实验表明,APASI 不仅有效缓解了三个基线模型的幻觉问题,还在无外部依赖的情况下实现了与基于对齐的方法相当甚至更好的性能,充分展示了其有效性和通用性。代码已公开于 https://github.com/davidluciolu/APASI。
引用
@article{arxiv.2509.11287,
title = {Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations},
author = {Yifan Lu and Ziqi Zhang and Chunfeng Yuan and Jun Gao and Congxuan Zhang and Xiaojuan Qi and Bing Li and Weiming Hu},
journal= {arXiv preprint arXiv:2509.11287},
year = {2025}
}
备注
emnlp 2025 accepted