中文

HOPE:一种基于强化学习的混合策略路径规划器,适用于多样化泊车场景

机器人学 2025-04-22 v4 机器学习

摘要

自动泊车是自动驾驶技术中备受期待的应用之一。然而,现有的路径规划方法由于无法处理现实中多样且复杂的泊车场景,未能满足这一需求。非学习方法虽然能提供可靠的规划结果,但在复杂情况下较为脆弱;而基于学习的方法善于探索,但在收敛到可行解方面不稳定。为了利用这两种方法的优势,我们引入了混合策略路径规划器(HOPE)。这一新颖的解决方案将强化学习智能体与Reeds-Shepp曲线相结合,能够在多样化的场景中实现有效规划。HOPE通过应用动作掩码机制来引导强化学习智能体的探索,并使用Transformer将感知到的环境信息与掩码进行整合。为了促进所提出规划器的训练和评估,我们提出了一种基于空间和障碍物分布来划分泊车场景难度等级的标准。实验结果表明,我们的方法优于典型的基于规则的算法和传统的强化学习方法,在各种场景中表现出更高的规划成功率和泛化能力。我们还进行了真实世界实验以验证HOPE的实用性。我们的解决方案代码已在https://github.com/jiamiya/HOPE上公开。

关键词

引用

@article{arxiv.2405.20579,
  title  = {HOPE: A Reinforcement Learning-based Hybrid Policy Path Planner for Diverse Parking Scenarios},
  author = {Mingyang Jiang and Yueyuan Li and Songan Zhang and Siyuan Chen and Chunxiang Wang and Ming Yang},
  journal= {arXiv preprint arXiv:2405.20579},
  year   = {2025}
}

备注

Accepted by T-ITS. 11 pages, 5 tables, 6 figures, 2 page appendix