全局指挥家与局部执行者:场景导航的双智能体框架
计算机视觉与模式识别
2026-02-24 v1
摘要
视觉语言场景导航是实现具身人机协作的基本能力,要求智能体遵循自然语言指令,在复杂环境中执行连贯的动作序列。现有方法要么依赖多个智能体,导致高额的协调和资源成本,要么采用单智能体范式,将全局规划与局部感知负担于一身,往往在长期视角下导致推理退化和指令漂移。为此,我们引入DACo,一种规划- grounding 解耦的架构,将全局 deliberation 与局部 grounding 彻底分离。具体而言,DACo采用全局指挥家进行高层战略规划,采用局部执行者进行颤动感知和精细执行。通过将全局推理与局部动作解耦,DACo缓解了认知负担,提高了长期视角稳定性。该框架进一步集成动态子目标规划和自适应重规划,以实现结构化且具韧性的导航。广泛的R2R、REVERIE和R4R上的评估表明,在零样本设置下,DACo相对于最佳基线实现了4.9%、6.5%、5.4%的绝对提升,并有效地跨越了封闭源(如GPT-4o)和开源(如Qwen-VL系列)底层。DACo为稳健的长期视角导航提供了一个原则且可扩展的范式。项目页面:https://github.com/ChocoWu/DACo
关键词
引用
@article{arxiv.2602.18941,
title = {Global Commander and Local Operative: A Dual-Agent Framework for Scene Navigation},
author = {Kaiming Jin and Yuefan Wu and Shengqiong Wu and Bobo Li and Shuicheng Yan and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2602.18941},
year = {2026}
}
备注
18 pages, 9 figures