中文

OctoNav: 迈向通用具身导航

计算机视觉与模式识别 2025-06-12 v1 人工智能 机器人学

摘要

具身导航是更广泛的具身AI追求中的基础支柱。然而,先前的导航研究被划分为不同的任务/能力,例如 ObjNav、ImgNav 和 VLN,它们在任务目标和模态上各不相同,导致数据集和方法各自独立设计。在本工作中,我们迈向通用导航代理,其可以遵循包含任意多模态和多能力组合的自由形式指令。为实现这一目标,我们提出了一个大规模基准和相应的方法,分别称为 OctoNav-Bench 和 OctoNav-R1。具体而言,OctoNav-Bench 具有连续环境,并通过设计的标注流水线构建。我们精心构建了指令-轨迹对,其中指令在自由形式上具有多样性,包含任意模态和能力。此外,我们在 OctoNav-Bench 中构建了 Think-Before-Action (TBA-CoT) 数据集,以提供行为背后的思考过程。对于 OctoNav-R1,我们基于多模态大语言模型(MLLMs)构建,并将其适配为 VLA 型模型,该模型仅基于2D视觉观测即可生成底层行为。此外,我们设计了一种混合训练范式(HTP),包含三个阶段,即 Action-/TBA-SFT、Nav-GPRO 和 Online RL 阶段。每个阶段包含专门设计的学习策略和奖励机制。重要的是,对于 TBA-SFT 和 Nav-GPRO 设计,我们受到 OpenAI-o1 和 DeepSeek-R1 的启发,它们通过先思考后回答展现了令人印象深刻的推理能力。因此,我们旨在探索如何在具身导航领域实现先思考后行为,以提升模型向通用代理的推理能力。具体而言,我们提出 TBA-SFT,利用 TBA-CoT 数据集对模型进行微调作为冷启动阶段,然后利用 Nav-GPRO 提升其思考能力。最后,OctoNav-R1 展现出优于先前方法的性能。

关键词

引用

@article{arxiv.2506.09839,
  title  = {OctoNav: Towards Generalist Embodied Navigation},
  author = {Chen Gao and Liankai Jin and Xingyu Peng and Jiazhao Zhang and Yue Deng and Annan Li and He Wang and Si Liu},
  journal= {arXiv preprint arXiv:2506.09839},
  year   = {2025}
}

备注

31 pages, 25 figures