中文

面向视觉语言模型的在线自校准:对抗幻觉

计算机视觉与模式识别 2026-05-04 v1 机器学习

摘要

大型视觉语言模型(LVLMs)常常因幻觉问题而生成包含输入图像中不存在的视觉细节的描述。最近的偏好对齐方法通常依赖来自更强模型(如 GPT)的监督,但这种离线范式会引入监督-感知不匹配:学生模型被迫对超出感知能力的细节进行对齐,学习猜测而非真正观察。为获得可靠的在线自监督,本文在 LVLMs 中识别出一种生成-判别差距(Generative-Discriminative Gap),即模型在判别性验证上表现优于开放式生成。基于此能力,我们提出一种集成蒙特卡洛树搜索与双粒度奖励机制的框架——"在线自校准"(OSCAR),以构建偏好数据并通过直接偏好优化进行迭代细化。大量实验表明,OSCAR 在幻觉基准测试中实现了最新性能,同时提升了通用多模态能力。

关键词

引用

@article{arxiv.2605.00323,
  title  = {Online Self-Calibration Against Hallucination in Vision-Language Models},
  author = {Minghui Chen and Chenxu Yang and Hengjie Zhu and Dayan Wu and Zheng Lin and Qingyi Si},
  journal= {arXiv preprint arXiv:2605.00323},
  year   = {2026}
}

备注

IJCAI 2026