中文

看到吗?缓解多模态大语言模型中的 OCR 幻觉

计算机视觉与模式识别 2025-09-23 v2

摘要

近期多模态大语言模型的进展通过集成文本和视觉信息增强了文档理解能力。然而,现有模型在实际场景下存在不完整性,尤其是在视觉退化情况下更为明显。在此类条件下,当前的响应范式往往未能充分感知视觉退化和模糊性,导致过度依赖语言先验或出现视觉-文本推理错位。这种对不确定性的识别困难常导致生成幻觉内容,尤其是在无法给出精确答案时更为突出。为更好地展示和分析这一现象与问题,我们提出 KIE-HVQA,这是首个专用于评估降质文档理解中 OCR 幻觉的基准测试。该数据集包含身份证和发票等测试样本,采用模拟真实退化以评估 OCR 可靠性。此设置允许在降质输入下评估模型区分可靠视觉信息并作出相应回答的能力,从而凸显在不确定数据上避免幻觉的挑战。为实现视觉忠实推理并避免上述问题,我们进一步引入基于 GRPO 的框架,具备新颖的奖励机制。通过纳入对视觉不确定性的自我意识,以及一种分析方法在受监督微调和强化学习框架中启动拒绝答复以增加任务难度,我们成功缓解了模糊区域的幻觉问题。在 Qwen2.5-VL 上的实验表明,所提 7B 参数模型相较于 GPT-4o 在 KIE-HVQA 上获得 22% 的绝对幻觉-free 准确率提升,且在标准任务中性能无显著下降,凸显了有效性和鲁棒性。

关键词

引用

@article{arxiv.2506.20168,
  title  = {Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models},
  author = {Zhentao He and Can Zhang and Ziheng Wu and Zhenghao Chen and Yufei Zhan and Yifan Li and Zhao Zhang and Xian Wang and Minghui Qiu},
  journal= {arXiv preprint arXiv:2506.20168},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025