中文

基于可组合扩散的动态环境下指令遵循导航

机器人学 2025-09-23 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

本文考虑的是使机器人能够在遵循指令的同时导航动态环境的技术挑战。核心难点在于指令规范的组合性:每条指令可以包含多个规范,而随着机器人技能集合的扩大,这些规范组合的可能数量呈指数增长。例如,“在保持道路右侧的同时超越行人”包含两个规范:“超越行人”和“沿道路右侧行走”。为应对这一挑战,我们提出了 ComposableNav 框架,基于以下直觉:遵循指令涉及独立满足其组成规范,每一规范对应于不同的运动原语。使用扩散模型,ComposableNav 分别学习每个原语,然后在部署时并行组合这些原语,以满足训练中未见过的新组合规范。此外,为避免对单个运动原语的演示需求,我们提出了两阶段训练程序:(1) 有监督的预训练,以学习动态导航的基础扩散模型;(2) 强化学习微调,将基础模型塑造成不同的运动原语。通过仿真和实际实验,我们展示了 ComposableNav 能够通过生成满足多样化且训练中未见过的规范组合的轨迹来遵循指令,显著优于非组合 VLM 基于策略和成本图组合基线。视频和其他材料可在项目页面 https://amrl.cs.utexas.edu/ComposableNav/ 查看。

关键词

引用

@article{arxiv.2509.17941,
  title  = {ComposableNav: Instruction-Following Navigation in Dynamic Environments via Composable Diffusion},
  author = {Zichao Hu and Chen Tang and Michael J. Munje and Yifeng Zhu and Alex Liu and Shuijing Liu and Garrett Warnell and Peter Stone and Joydeep Biswas},
  journal= {arXiv preprint arXiv:2509.17941},
  year   = {2025}
}

备注

Conference on Robot Learning (CoRL) 2025 Project site: https://amrl.cs.utexas.edu/ComposableNav/