中文

基于鲁棒感知导航:使用带学习值函数的 PAC-NMPC

机器人学 2025-06-11 v3

摘要

非线性模型预测控制(NMPC)通常受限于较短的有限时域,以减轻在线优化的计算负担。因此,在复杂环境中使用 NMPC 进行导航时,通常需要全局规划框架以避免局部极小值。相比之下,强化学习(RL)可以生成最小化无限时域期望代价的策略,并且即使仅基于当前传感器测量值运行,也常能避免局部极小值。然而,这些学习到的策略通常无法提供性能保证(例如关于碰撞避免),尤其是在训练分布之外时。在本文中,我们增强了 Probably Approximately Correct NMPC(PAC-NMPC)——一种基于采样的随机 NMPC 算法,能够提供统计性的性能与安全性保证——使其结合通过 RL 训练的近似基于感知的值函数。我们在仿真中证明,我们的算法能够改善 PAC-NMPC 的长期行为,同时在平面车辆动力学和更复杂、高维的固定翼飞行器动力学的安全性方面优于其他方法。我们还证明,即使我们的值函数是在仿真中训练的,我们的算法也能在使用 1/10 比例拉力赛车、仅利用当前传感器信息的杂乱真实世界环境中,在硬件上成功实现统计安全的导航。

关键词

引用

@article{arxiv.2309.13171,
  title  = {Robust Perception-Based Navigation using PAC-NMPC with a Learned Value Function},
  author = {Adam Polevoy and Mark Gonzales and Marin Kobilarov and Joseph Moore},
  journal= {arXiv preprint arXiv:2309.13171},
  year   = {2025}
}

备注

This work has been submitted to the IEEE for possible publication