中文

稀疏潜在引导以缓解大型视觉语言模型中的对象幻觉

人工智能 2026-05-12 v2 机器学习

摘要

尽管大型视觉语言模型 (LVLMs) 具备先进能力,但常因对象幻觉而受限。其原因之一是视觉特征与预训练文本表示在深层网络中常被紧密交织。为此,我们提出 REVIS 框架,旨在训练-free 方式显式重新激活被抑制的视觉信息。基于潜在空间几何学,REVIS 通过正交投影提取纯视觉信息向量,并采用校准策略仅在抑制发生的精确深度进行稀疏干预。该外科手术方法以最小计算成本有效恢复视觉信息。经典基准测试的实证评估表明,REVIS 比最先进的基线方法约降低 19% 对象幻觉率,同时保持通用推理能力。

关键词

引用

@article{arxiv.2602.11824,
  title  = {Revis: Sparse Latent Steering to Mitigate Object Hallucination in Large Vision-Language Models},
  author = {Jialin Wu and Wei Shi and Han Shen and Peigui Qi and Kunsheng Tang and Zhicong Huang and Binghao Wang and Zhou Yang},
  journal= {arXiv preprint arXiv:2602.11824},
  year   = {2026}
}

备注

Accepted by ICML 2026