基于迭代视觉 grounding 框架的通用视觉关系检测:从幻想到 grounding 再到重复
计算机视觉与模式识别
2025-06-09 v1
摘要
理解物体之间的关系是视觉智能的核心任务,具有在具身人工智能、辅助系统和场景理解等方面的应用。然而,大多数视觉关系检测(VRD)模型依赖固定的谓词集合,限制了其对新型交互的泛化能力。一个关键挑战是无法对从外部知识推断出的、在注释中未出现的、在语义上合理但未被注释的关系进行视觉 grounding。本工作引入一种迭代视觉 grounding 框架,利用大语言模型(LLM)作为结构化关系先验。受期望最大化(EM)算法启发,我们的方法在交替生成通过检测物体生成候选场景图(期望步)和训练视觉模型将这些假设与感知证据对齐(最大化步)之间工作。该过程为超越注释数据所需的关系理解提供了引导,使其能够对未见过的谓词实现泛化。此外,我们引入了一个在 Visual Genome 上进行的新基准测试,包含 21 个 held-out 谓词,并在见、未见和混合三种设置下进行评估。我们的模型在这三个集合上的谓词分类平均召回率(mR@50)分别为 15.9、13.1 和 11.7,超越了 LLM-only、few-shot 和去偏 baselines。这些结果凸显了基于 grounding LLM 先验在可扩展的开放式视觉理解中的潜力。
关键词
引用
@article{arxiv.2506.05651,
title = {Hallucinate, Ground, Repeat: A Framework for Generalized Visual Relationship Detection},
author = {Shanmukha Vellamcheti and Sanjoy Kundu and Sathyanarayanan N. Aakur},
journal= {arXiv preprint arXiv:2506.05651},
year = {2025}
}
备注
22 pages, 9 figures, 5 tables