面向视觉专家的草稿与细化
计算机视觉与模式识别
2026-03-19 v3
摘要
虽然近期的大型视觉语言模型 (LVLMs) 在多模态推理方面表现出强大的能力,但它们常常会产生不切实际或幻觉的响应,因为过度依赖语言先验而非视觉证据。这一局限性凸显了缺乏量化衡量这些模型在推理过程中实际依赖视觉信息的程度。我们提出了草稿与细化 (DnR) 框架,该框架由一个基于问题条件化的利用率度量驱动。该度量通过首先构建查询条件化的相关性图以局部化问题相关线索,然后通过相关性引导的概率遮蔽来衡量依赖程度,从而量化模型对视觉证据的依赖。该框架利用该度量指导草稿的细化,借助外部视觉专家提供的针对性反馈进行优化。每个专家的输出(如边界框或掩码)被渲染为图像上的视觉线索,模型随后被重新查询,以选择利用率提升最大的响应。该过程在不进行重新训练或架构修改的情况下加强了视觉锚定。跨 VQA 和 captioning 基准测试的实验显示,DnR 在准确率和幻觉减少方面均实现了一致的提升,表明衡量视觉利用率为构建更具可解释性和以证据为导向的多模态智能体系统提供了原则性的路径。代码已公开于 https://github.com/EavnJeong/Draft-and-Refine-with-Visual-Experts。
引用
@article{arxiv.2511.11005,
title = {Draft and Refine with Visual Experts},
author = {Sungheon Jeong and Ryozo Masukawa and Jihong Park and Sanggeon Yun and Wenjun Huang and Hanning Chen and Mahdi Imani and Mohsen Imani},
journal= {arXiv preprint arXiv:2511.11005},
year = {2026}
}
备注
Accepted to CVPR 2026