GroundSight:通过引入定位信息增强视觉语言模型并消除幻觉
人工智能
2025-10-01 v1
摘要
我们提出了一种改进视觉问答(VQA)的方法,采用检索增强生成(RAG)技术,通过引入文本关联目标定位来实现。不同于基于整个图像检索信息,我们的方法使模型能够在与问题最相关的目标周围生成边界框,从而实现针对性的图像裁剪和聚焦检索。这减少了背景噪声,提高了视觉与文本线索之间的对齐度,有助于缓解幻觉问题。我们的RAG方法提升了基于上下文的VQA响应准确率,从22.19%提高到25.64%,绝对提升3.45个百分点,较基线Llama-3.2-Vision-11B智能体。我们还提出了一种基于问题类型的去幻觉方法,能够有效将幻觉率从65.79%降低到13.88%,并提高了真实性评分。
引用
@article{arxiv.2509.25669,
title = {GroundSight: Augmenting Vision-Language Models with Grounding Information and De-hallucination},
author = {Xinxi Chen and Tianyang Chen and Lijia Hong},
journal= {arXiv preprint arXiv:2509.25669},
year = {2025}
}