中文

明确大型视觉语言模型的知识边界

计算机视觉与模式识别 2026-04-30 v1 人工智能

摘要

大型视觉语言模型(VLMs)在多模态任务上取得了显著进展,但仍容易产生事实性幻觉,尤其是在长尾或专业领域。此外,当前模型对超出其参数化知识范围的查询缺乏拒绝能力。在本文中,我们提出了系统性框架以增强VLMS在面对此类未知问题时的拒绝能力。我们首先构建模型特定的"Visual-Idk"(Visual-I don't know)数据集,利用多样本一致性探测技术区分已知与未知事实。随后,我们通过监督微调和偏好感知优化(如 DPO、ORPO)对模型进行对齐,以有效描绘其知识边界。Visual-Idk 数据集上的结果表明,我们的方法将 Truthful Rate 从57.9% 提升至67.3%。此外,内部探测也表明模型真正识别了其边界,而不仅仅是记忆拒绝模式。我们的框架进一步推广到医学和感知领域的 out-of-distribution 测试,为通往更可信稳健的视觉助理提供了可靠路径。

关键词

引用

@article{arxiv.2604.26419,
  title  = {Delineating Knowledge Boundaries for Honest Large Vision-Language Models},
  author = {Junru Song and Yimeng Hu and Yijing Chen and Huining Li and Qian Li and Lizhen Cui and Yuntao Du},
  journal= {arXiv preprint arXiv:2604.26419},
  year   = {2026}
}