SAVER:通过风格感知视觉早期修订缓解大型视觉-语言模型中的幻觉问题
计算机视觉与模式识别
2025-08-06 v1
摘要
大型视觉-语言模型(LVLMs)最近在理解复杂视觉-文本语境方面取得了显著进展。然而,幻觉问题仍限制了其实际应用。尽管以前的缓解方法有效减少了摄影图像中的幻觉,但大量忽略了风格化图像所带来的潜在风险,这些图像在游戏场景理解、艺术教育和医疗分析等关键场景中发挥着关键作用。本文首先构建了一个包含摄影图像及其对应风格化版本的数据集,并对其进行仔细标注。随后,我们通过对收集的数据集进行基准测试,对13个先进的LVLMs进行判别性和生成性任务的头战比较。我们的发现表明,风格化图像会引发显著多于其摄影对等物的幻觉。为此,我们提出了一种名为Style-Aware Visual Early Revision(SAVER)的新型机制,通过动态调整基于标记级别视觉注意力模式的最终输出,利用早期图层反馈来缓解由风格化图像引起的幻觉。广泛的实验表明,SAVER在各种模型、数据集和任务上的幻觉缓解性能实现了现阶段最佳水平。
引用
@article{arxiv.2508.03177,
title = {SAVER: Mitigating Hallucinations in Large Vision-Language Models via Style-Aware Visual Early Revision},
author = {Zhaoxu Li and Chenqi Kong and Yi Yu and Qiangqiang Wu and Xinghao Jiang and Ngai-Man Cheung and Bihan Wen and Alex Kot and Xudong Jiang},
journal= {arXiv preprint arXiv:2508.03177},
year = {2025}
}