中文

熵-梯度 grounding:视觉语言模型中的无训练证据检索

计算机视觉与模式识别 2026-04-10 v1 计算与语言

摘要

尽管取得了快速进展,预训练视觉语言模型在答案依赖于微小视觉细节或需跨多个区域整合线索的情况下仍表现不佳,例如在文档和组合查询中。我们通过将 grounding 视为测试时证据检索来解决此问题:给定查询,模型应主动识别下一步应关注的区域以消除歧义。为此,我们提出一种无训练、基于模型内在的 grounding 方法,该方法利用不确定性作为监督。具体而言,我们计算模型下一个 token 分布的熵,并对其反向传播到视觉 token 嵌入中,以获得熵-梯度相关性图,而无需辅助检测器或注意力图启发式方法。我们然后提取并排序多个连贯区域以支持多证据查询,引入一种带有空间熵停止规则的迭代放大和重新定位程序,以避免过度细化。实验在四个 VLM 架构的七个基准上表明,本方法一致地优于现有方法,在 detail-critical 和高分辨率设置中获得最大提升,同时也产生更具解释性的证据局部化。

关键词

引用

@article{arxiv.2604.08456,
  title  = {Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models},
  author = {Marcel Gröpl and Jaewoo Jung and Seungryong Kim and Marc Pollefeys and Sunghwan Hong},
  journal= {arXiv preprint arXiv:2604.08456},
  year   = {2026}
}

备注

Project Page : https://entropy-gradient-grounding.github.io/