通过屏障调节的自适应闭形式驾驶消除视觉语言模型幻觉
计算机视觉与模式识别
2026-05-29 v1 人工智能
摘要
大型视觉语言模型(LVLMs)常因视觉定位减弱而产生幻觉对象。现有推理时消除方法修改logits或隐藏状态,但存在三个关键局限:缺乏显式定位目标、干预时机不当以及校正强度固定。我们提出BRACS(Barrier-Regulated Adaptive Closed-form Steering),一种训练免费的驾驶框架,通过屏障调节自适应闭形式驾驶消除这些问题。BRACS监控模型对视觉定位程度,仅在定位恶化时应用校正。校正更新以闭式解析形式计算,无需辅助网络训练或模型再训练。在LLaVA-1.5-7B和Qwen-VL-Chat上实验表明,BRACS在幻觉基准测试中一致优于先前方法,CHAIR降低9.4分,POPE F1提升2.7分,同时在四个通用多模态基准测试中保持或提升性能。BRACS同样高效,仅为贪婪解码吞吐量的80%,平均快于基线1.3倍。
引用
@article{arxiv.2605.29881,
title = {Mitigating Hallucination in Vision-Language Models through Barrier-Regulated Adaptive Closed-form Steering},
author = {Soumyadeep Jana and Pulkit Mittal and Sanasam Ranbir Singh},
journal= {arXiv preprint arXiv:2605.29881},
year = {2026}
}