中文

基于迭代视觉 grounding 框架的通用视觉关系检测:从幻想到 grounding 再到重复

计算机视觉与模式识别 2025-06-09 v1

摘要

理解物体之间的关系是视觉智能的核心任务,具有在具身人工智能、辅助系统和场景理解等方面的应用。然而,大多数视觉关系检测(VRD)模型依赖固定的谓词集合,限制了其对新型交互的泛化能力。一个关键挑战是无法对从外部知识推断出的、在注释中未出现的、在语义上合理但未被注释的关系进行视觉 grounding。本工作引入一种迭代视觉 grounding 框架,利用大语言模型(LLM)作为结构化关系先验。受期望最大化(EM)算法启发,我们的方法在交替生成通过检测物体生成候选场景图(期望步)和训练视觉模型将这些假设与感知证据对齐(最大化步)之间工作。该过程为超越注释数据所需的关系理解提供了引导,使其能够对未见过的谓词实现泛化。此外,我们引入了一个在 Visual Genome 上进行的新基准测试,包含 21 个 held-out 谓词,并在见、未见和混合三种设置下进行评估。我们的模型在这三个集合上的谓词分类平均召回率(mR@50)分别为 15.9、13.1 和 11.7,超越了 LLM-only、few-shot 和去偏 baselines。这些结果凸显了基于 grounding LLM 先验在可扩展的开放式视觉理解中的潜力。

关键词

引用

@article{arxiv.2506.05651,
  title  = {Hallucinate, Ground, Repeat: A Framework for Generalized Visual Relationship Detection},
  author = {Shanmukha Vellamcheti and Sanjoy Kundu and Sathyanarayanan N. Aakur},
  journal= {arXiv preprint arXiv:2506.05651},
  year   = {2025}
}

备注

22 pages, 9 figures, 5 tables