grounding 视觉事实化:基于事实锚点的数据微调以增强多模态大语言模型的事实一致性
计算与语言
2025-11-17 v1 计算机视觉与模式识别
摘要
视觉幻觉现象——多模态大语言模型生成与图像内容不一致的细节——严重削弱了其可靠性。现有微调方法效果有限,无法深入介入事实推理。本文引入grounding 视觉事实化(GVF)微调,一种系统性提升多模态大语言模型视觉事实一致性的新方法。GVF通过三大核心机制整合显式事实信号:事实锚点数据增强(通过结构化事实锚点和反事实提示丰富训练数据)、事实感知指令微调(将这些线索嵌入显式指令)以及事实一致性损失函数(专门惩罚事实错误)。在LLaVA-1.5-13B模型上评估,GVF微调在VHTest基准测试中对开放式问题(OEQ)和是/否问题(YNQ)格式均显著优于标准微调方法。重要的是,GVF在MME和POPE等通用多模态基准测试中保持或略微提升性能,显示有效缓解了视觉幻觉,而不损害通用理解与推理能力。
引用
@article{arxiv.2511.10671,
title = {Grounded Visual Factualization: Factual Anchor-Based Finetuning for Enhancing MLLM Factual Consistency},
author = {Filippo Morbiato and Luca Romano and Alessandro Persona},
journal= {arXiv preprint arXiv:2511.10671},
year = {2025}
}