VisDoT:通过类人解释 grounding 与思维分解提升视觉推理
人工智能
2026-03-13 v1 计算机视觉与模式识别
摘要
大型视觉语言模型(LVLMs)在图表中可靠检测视觉原语并将其与语义表示对齐方面存在困难,这严重限制了其在复杂视觉推理任务上的性能。这种缺乏感知 grounding 构成了图表推理的主要瓶颈。我们提出 VisDoT 框架,通过类人解释 grounding 提升视觉推理。我们基于图形感知理论, formalize 四个感知任务,包括位置和长度。基于此,我们引入思维分解(DoT)提示,依次将问题分解为视觉感知子问题和逻辑子问题。使用 VisDoT 对 InternVL 进行微调后,在 ChartQA 上实现 +11.2% 的提升,并在更具挑战性的 ChartQAPro benchmark 上超越 GPT-4o。在新引入的 VisDoTQA benchmark 上,模型提升了 +33.2%。此外,一致的零样本提升在多样化的开放域 VQA benchmark 上表明,感知-逻辑分离策略对视觉问答具有普适性。VisDoT 利用类人感知提升视觉 grounding,实现了图表理解的最新进展和可解释的视觉推理。
引用
@article{arxiv.2603.11631,
title = {VisDoT : Enhancing Visual Reasoning through Human-Like Interpretation Grounding and Decomposition of Thought},
author = {Eunsoo Lee and Jeongwoo Lee and Minki Hong and Jangho Choi and Jihie Kim},
journal= {arXiv preprint arXiv:2603.11631},
year = {2026}
}
备注
30 pages, 21 figures, EACL 2026 Findings