中文

GroundSight:通过引入定位信息增强视觉语言模型并消除幻觉

人工智能 2025-10-01 v1

摘要

我们提出了一种改进视觉问答(VQA)的方法,采用检索增强生成(RAG)技术,通过引入文本关联目标定位来实现。不同于基于整个图像检索信息,我们的方法使模型能够在与问题最相关的目标周围生成边界框,从而实现针对性的图像裁剪和聚焦检索。这减少了背景噪声,提高了视觉与文本线索之间的对齐度,有助于缓解幻觉问题。我们的RAG方法提升了基于上下文的VQA响应准确率,从22.19%提高到25.64%,绝对提升3.45个百分点,较基线Llama-3.2-Vision-11B智能体。我们还提出了一种基于问题类型的去幻觉方法,能够有效将幻觉率从65.79%降低到13.88%,并提高了真实性评分。

关键词

引用

@article{arxiv.2509.25669,
  title  = {GroundSight: Augmenting Vision-Language Models with Grounding Information and De-hallucination},
  author = {Xinxi Chen and Tianyang Chen and Lijia Hong},
  journal= {arXiv preprint arXiv:2509.25669},
  year   = {2025}
}