一个标记,两种命运:通过视觉标记操作统一框架对抗多模态大语言模型幻觉
计算机视觉与模式识别
2026-03-12 v1
摘要
当前的无训练方法采用分离策略来应对多模态大语言模型(MLLM)的幻觉:要么增强视觉信号,要么抑制文本惯性。然而,由于关键的权衡,这些分离的方法是不够的:单纯增强视觉通常难以对抗强大的语言先验,而抑制语言可能会引入额外的与图像无关的噪声。此外,我们发现它们的简单组合也无效,因此需要一个统一框架。我们通过关注核心资产——视觉标记,提出了这样一个框架。我们的设计利用了两种关键见解:(1)增强图像提供了互补的视觉语义;(2)移除视觉标记(信息差距)比扭曲图像(模态差距)能更精确地隔离幻觉倾向。基于这些,我们的框架以两种不同方式使用视觉标记,两者都在潜在表示上操作:我们的协同视觉校准(SVC)模块整合增强标记以强化视觉表示,而我们的因果表示校准(CRC)模块使用修剪后的标记创建潜在空间负样本,用于纠正内部模型偏差。通过协调这两种角色,我们的框架有效恢复了视觉-语言平衡,显著减少了对象幻觉,在多个基准上使 LLaVA-1.5 的 POPE 准确率平均提高了 2% 的绝对值,且推理延迟开销仅为 1.06 倍。
引用
@article{arxiv.2603.10360,
title = {One Token, Two Fates: A Unified Framework via Vision Token Manipulation Against MLLMs Hallucination},
author = {Zhan Fa and Yue Duan and Jian Zhang and Lei Qi and Yinghuan Shi},
journal= {arXiv preprint arXiv:2603.10360},
year = {2026}
}
备注
10 pages