中文

基于强化学习的纯追踪法实现自主赛车中的动态前瞻距离

机器人学 2026-03-31 v1 人工智能 系统与控制 系统与控制

摘要

纯追踪法(PP)因其简单性和实时性能而广泛用于自主车辆的路径跟踪。然而,其有效性对前瞻距离的选择敏感:较短值改善弯道跟踪但可能导致直道不稳定,而较长值改善平滑性但降低弯道精度。我们提出了一种混合控制框架,将近端策略优化(PPO)与经典纯追踪控制器相结合,以在赛车过程中动态调整前瞻距离。PPO 智能体将车速和多视野曲率特征映射为在线前瞻指令。它在 F1TENTH Gym 模拟器中使用 Stable-Baselines3 进行训练,采用 KL 惩罚和学习率衰减以保证稳定性,然后部署在 ROS2 环境中以指导控制器。仿真实验将所提方法与固定前瞻纯追踪法和自适应纯追踪基线进行了比较。额外的实车实验将学习到的控制器与固定前瞻纯追踪控制器进行了比较。结果表明,学习到的策略改善了单圈时间性能并在未见过的赛道上实现了重复单圈完成,同时实现了零样本迁移到硬件。学习到的控制器通过直道上增大前瞻距离、弯道中减小前瞻距离来适应前瞻距离,展示了通过在线适应单一可解释参数来增强经典控制器的有效性。在未见过的赛道上,所提方法在蒙特利尔赛道上实现了 33.16 秒,在雅马纳赛道上实现了 46.05 秒,同时比基线容忍更激进的速度曲线缩放,并在所有测试设置中取得了最佳单圈时间。初步实车实验进一步支持了在 1:10 比例自主赛车平台上的仿真到现实迁移。

关键词

引用

@article{arxiv.2603.28625,
  title  = {Dynamic Lookahead Distance via Reinforcement Learning-Based Pure Pursuit for Autonomous Racing},
  author = {Mohamed Elgouhary and Amr S. El-Wakeel},
  journal= {arXiv preprint arXiv:2603.28625},
  year   = {2026}
}