中文

PROSPECT:通过语义-空间融合与潜在预测表示实现统一的流式视觉-语言导航

机器人学 2026-03-20 v3

摘要

多模态大语言模型(MLLM)已推进零-shot end-to-end Vision-Language Navigation(VLN),但鲁健的导航需要不仅进行语义理解,还要对环境动力学和空间结构进行预测建模。我们提出 PROSPECT,一个统一的流式导航智能体,将流式 Vision-Language-Action(VLA)策略与潜在预测表示学习相结合。PROSPECT 使用 CUT3R 作为流式 3D 基础空间编码器,以产生 long-context、绝对尺度空间特征,并通过交叉注意力将其与 SigLIP 语义特征融合。在训练期间,我们引入可学习的 stream query token,以查询流式上下文并预测下一步 2D 和 3D 潜在特征(而非像素或显式模态),在冻结的 SigLIP 和 CUT3R teacher 的潜在空间中进行监督。预测分支在不增加推理开销的前提下塑造内部表示。在 VLN-CE benchmark 和 real-robot deployment 实验中,我们实现了 state-of-the-art 的性能和在多样化光照条件下 improved long-horizon robust ness。我们将不久后向社区发布代码。

关键词

引用

@article{arxiv.2603.03740,
  title  = {Whole-Body Safe Control of Robotic Systems with Koopman Neural Dynamics},
  author = {Sebin Jung and Abulikemu Abuduweili and Jiaxing Li and Changliu Liu},
  journal= {arXiv preprint arXiv:2603.03740},
  year   = {2026}
}