DeepScan:面向大型视觉语言模型的无训练视觉 grounding 推理框架
计算机视觉与模式识别
2026-03-05 v1
摘要
人类能够通过识别关键线索并自下而上地将其与完整情境关联,即使在嘈杂环境中也能稳健地定位视觉证据并提供 grounded 回答。 Inspired by this, 我们提出 DeepScan,一个无训练的框架,结合层次化扫描、重新聚焦与证据增强推理,用于大型视觉语言模型(LVLMs)中的视觉 grounding 推理。不同于追求一次性完整证据局部化的现有方法,层次化扫描进行局部线索探索与多尺度证据提取,以自下而上方式恢复证据,有效缓解干扰性上下文的影响。重新聚焦随后通过 LVLMs 与视觉专家的协作优化局部证据视角。最后,证据增强推理通过混合证据记忆聚合多粒度视角,生成准确且可解释的回答。实验结果表明,DeepScan 在 diverse 视觉任务中显著提升 LVLMs 的性能,尤其在细粒度视觉理解方面。集成 Qwen2.5-VL-7B 时,达到 90.6% 的整体准确率。此外,DeepScan 在各种架构和模型规模下均能提供 consistent 改进,且无需额外适配成本。
引用
@article{arxiv.2603.03857,
title = {DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models},
author = {Yangfu Li and Hongjian Zhan and Jiawei Chen and Yuning Gong and Qi Liu and Yue Lu},
journal= {arXiv preprint arXiv:2603.03857},
year = {2026}
}
备注
18 pages 17 figures