中文

基于奖励增强的强化学习在精确自动泊车中的连续控制策略优化

机器人学 2025-08-05 v2 系统与控制 系统与控制

摘要

自动泊车(AP)是智能车辆自动化中的一个关键且复杂的子领域,具有紧凑的空间约束、频繁的近距离障碍物交互以及严格的安全裕度。然而,传统的基于规则的方法和模型预测方法往往缺乏处理AP非线性及环境依赖性复杂性所需的适应性和泛化能力。为此,我们提出了一种用于自动泊车的奖励增强学习框架(RARLAP),通过结构化奖励设计来缓解连续域控制的内在复杂性,从而诱导平滑且具有适应性的策略行为,该框架在高保真的Unity-based自定义3D仿真环境中进行训练。我们系统性地设计并评估了三种结构化奖励策略:目标-only奖励(GOR)、密集 Proximity奖励(DPR)和里程碑增强奖励(MAR),每种奖励策略均集成了基于on-policy和off-policy优化范式。经验评估表明,基于on-policy的MAR实现了91%的成功率,产生更平滑的轨迹和更稳健的行为,而GOR和DPR未能有效引导学习。收敛性和轨迹分析表明,本文提出的框架增强了策略的适应性,加速了训练过程,并提高了连续控制中的安全性。总体而言,RARLAP表明奖励增强有效地解决了复杂的自动泊车挑战,使基于on-和off-policy方法的策略优化具有可扩展性和效率。为支持可重复性,本文附带的代码已公开提供。

关键词

引用

@article{arxiv.2507.19642,
  title  = {Reward-Augmented Reinforcement Learning for Continuous Control in Precision Autonomous Parking via Policy Optimization Methods},
  author = {Ahmad Suleman and Misha Urooj Khan and Zeeshan Kaleem and Ali H. Alenezi and Iqra Shabbir and Sinem Coleri and Chau Yuen},
  journal= {arXiv preprint arXiv:2507.19642},
  year   = {2025}
}