中文

通过屏障调节的自适应闭形式驾驶消除视觉语言模型幻觉

计算机视觉与模式识别 2026-05-29 v1 人工智能

摘要

大型视觉语言模型(LVLMs)常因视觉定位减弱而产生幻觉对象。现有推理时消除方法修改logits或隐藏状态,但存在三个关键局限:缺乏显式定位目标、干预时机不当以及校正强度固定。我们提出BRACS(Barrier-Regulated Adaptive Closed-form Steering),一种训练免费的驾驶框架,通过屏障调节自适应闭形式驾驶消除这些问题。BRACS监控模型对视觉定位程度,仅在定位恶化时应用校正。校正更新以闭式解析形式计算,无需辅助网络训练或模型再训练。在LLaVA-1.5-7B和Qwen-VL-Chat上实验表明,BRACS在幻觉基准测试中一致优于先前方法,CHAIRs_s降低9.4分,POPE F1提升2.7分,同时在四个通用多模态基准测试中保持或提升性能。BRACS同样高效,仅为贪婪解码吞吐量的80%,平均快于基线1.3倍。

关键词

引用

@article{arxiv.2605.29881,
  title  = {Mitigating Hallucination in Vision-Language Models through Barrier-Regulated Adaptive Closed-form Steering},
  author = {Soumyadeep Jana and Pulkit Mittal and Sanasam Ranbir Singh},
  journal= {arXiv preprint arXiv:2605.29881},
  year   = {2026}
}