中文

面向大型视觉语言模型的 hallucination 缓解探索

计算机视觉与模式识别 2025-09-18 v1 计算与语言

摘要

大型视觉语言模型(LVLMs)中的对象幻觉显著阻碍了其实际应用。作为准确解释视觉信息的关键组件,视觉编码器的选择至关重要。我们假设,不同视觉编码器所采用的数据训练范式赋予它们不同的归纳偏置,进而导致其在幻觉表现上的差异。现有基准通常聚焦于粗粒度幻觉检测,无法捕捉我们假设中所描述的多样化幻觉。为系统性地分析这些影响,我们引入VHBench-10,一个包含约1万个样本的综合性基准,用于评估LVLMs在十个细粒度幻觉类别中的表现。我们的评估确认不同编码器具有独特的幻觉特征。基于这些洞见以及简单特征融合的次优性,我们提出了VisionWeaver,一种 novel 上下文感知路由网络。它利用全局视觉特征生成路由信号,动态聚合来自多个专家专家的视觉特征。全面的实验确认VisionWeaver在显著降低幻觉方面效果显著,同时提升了整体模型性能。

关键词

引用

@article{arxiv.2509.13836,
  title  = {Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models},
  author = {Weihang Wang and Xinhao Li and Ziyue Wang and Yan Pang and Jielei Zhang and Peiyi Li and Qiang Zhang and Longwen Gao},
  journal= {arXiv preprint arXiv:2509.13836},
  year   = {2025}
}

备注

Accepted by EMNLP2025 Finding