见不同,思考更好:视觉变体缓解 LVLMs 幻觉现象
计算机视觉与模式识别
2025-07-31 v2
摘要
大型视觉语言模型 (LVLMs) 在视觉理解和多模态推理方面展现出惊人的能力,但经常出现幻觉现象,即生成的文本响应与提供的视觉内容不一致。现有幻觉缓解方法主要以文本为中心,视觉语义对齐的挑战显著限制了其效果,尤其在面对细粒度视觉理解场景时。为此,本文提出 ViHallu,一个以视觉为中心的幻觉缓解框架,通过视觉变体图像生成和视觉指令构建来增强视觉语义对齐。ViHallu 引入保持整体图像结构的可控视觉变体图像。这些图像结合精心构建的视觉指令,使 LVLMs 通过微调更好地理解细粒度视觉内容,从而更精确地捕获视觉内容与文本之间的对应关系,增强视觉语义对齐。大量基准测试表明,ViHallu 有效提升了模型的细粒度视觉理解,显著降低了幻觉倾向。此外,我们发布了 ViHallu-Instruction,一个专为幻觉缓解和视觉语义对齐设计的视觉指令数据集。代码已公开 https://github.com/oliviadzy/ViHallu。
引用
@article{arxiv.2507.22003,
title = {See Different, Think Better: Visual Variations Mitigating Hallucinations in LVLMs},
author = {Ziyun Dai and Xiaoqiang Li and Shaohua Zhang and Yuanchen Wu and Jide Li},
journal= {arXiv preprint arXiv:2507.22003},
year = {2025}
}
备注
Accepted by ACM MM25