中文

视觉共享协作:基于同伴观察的视觉-语言导航

计算机视觉与模式识别 2026-03-24 v1 机器人学

摘要

视觉-语言导航(VLN)系统受限于部分可观测性,因为代理人只能从其亲自访问的位置获取知识。随着多个机器人在共享环境中共存,一个自然问题随之而来:同一空间中的代理人能否从彼此的观察中受益?本文引入 Co-VLN,一个最小化且模型无关的框架,用于系统性地调查同伴观察在 VLN 中的收益及其作用机制。在代理人独立导航时识别到公共遍历位置后,他们会交换结构化的感知记忆,从而在不额外探索成本的情况下扩大每个代理人的感知范围。我们在 R2R 数据集基准上验证了该框架,采用学习型 DUET 和零样态 MapGPT 两种代表性方法,并开展了大量分析实验,以系统性揭示同伴观察共享在 VLN 中的底层动力学。结果表明,启用视觉共享的模型在两种方法下均实现了显著的性能提升,为基于协作式具身导航的后续研究奠定了坚实基础。

关键词

引用

@article{arxiv.2603.20804,
  title  = {Does Peer Observation Help? Vision-Sharing Collaboration for Vision-Language Navigation},
  author = {Qunchao Jin and Yiliao Song and Qi Wu},
  journal= {arXiv preprint arXiv:2603.20804},
  year   = {2026}
}