中文

NavOL:基于在线模仿学习的导航策略

机器人学 2026-05-13 v1

摘要

学习鲁棒的导航策略是机器人学中的核心挑战。离线模仿学习受分布迁移和滚动中的累积误差影响,而强化学习则需要奖励工程且学习效率低下。本文提出NavOL,一种基于在线模仿学习的范式,通过与模拟器交互并使用在线收集的专家演示进行自我更新。基于预训练的导航扩散策略,NavOL在滚动更新循环中训练:在滚动过程中,策略在模拟器中行动并查询全局规划器,该规划器利用对全局环境的特权访问获取最优路径片段作为ground truth轨迹标签;在更新过程中,策略在收集的在线观察-轨迹对上进行训练。这种在线模仿循环消除了奖励设计的需求,提高了学习效率,并通过训练自身探索的轨迹来缓解分布迁移问题。基于IsaacLab的快速高保真并行渲染和相机姿态及起点-终点对的域随机化,本系统可在50个场景中扩展到8台RTX 4090 GPU上,每小时收集超过2,000条新轨迹,每条轨迹平均超过400步。我们还引入了一个室内视觉导航基准,包含预定义的起点和终点位置,用于零样本泛化。广泛的评估包括NavDP基准和我们提出的基准,以及精心设计的实际实验,都表明NavOL的有效性,显示出在线模仿学习中持续的性能提升。

关键词

引用

@article{arxiv.2605.11762,
  title  = {NavOL: Navigation Policy with Online Imitation Learning},
  author = {Xiaofei Wei and Chun Gu and Li Zhang},
  journal= {arXiv preprint arXiv:2605.11762},
  year   = {2026}
}

备注

Project page: https://logosroboticsgroup.github.io/NavOL/