中文

连接各点:通过智能体推理实现无需训练的视觉定位

计算机视觉与模式识别 2025-11-27 v2

摘要

视觉定位,即将文本查询链接到图像中特定区域的任务,在视觉语言集成中扮演着关键角色。现有方法通常依赖大量任务特定标注和微调,限制了它们有效泛化到新分布外场景的能力。为应对这些局限,我们引入GroundingAgent,一个无需任何任务特定微调的新型智能体视觉定位框架。GroundingAgent采用结构化的迭代推理机制,整合预训练的开放词汇目标检测器、多模态大语言模型(MLLM)和大语言模型(LLM),通过联合语义和空间分析逐步精炼候选区域。值得注意的是,GroundingAgent在广泛使用的基准(RefCOCO、RefCOCO+、RefCOCOg)上实现了平均65.1%的零样本定位准确率,完全无需微调。此外,通过用原始查询文本替换MLLM生成的描述,仅选择阶段的准确率达到约90%,接近监督性能,突显了LLM推理能力的关键作用。GroundingAgent还提供了强大的可解释性,透明地展示每一步推理过程,并为其决策提供清晰的见解。

关键词

引用

@article{arxiv.2511.19516,
  title  = {Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning},
  author = {Liqin Luo and Guangyao Chen and Xiawu Zheng and Yongxing Dai and Yixiong Zou and Yonghong Tian},
  journal= {arXiv preprint arXiv:2511.19516},
  year   = {2025}
}

备注

AAAI 2026