基于 3D 高斯溶解模拟器的强化学习端到端自主停车:Real2Sim2Real 传输
机器人学
2026-05-12 v1 人工智能
摘要
近年来,自主停车取得了显著进展,但在机械和死角停车位等极端场景中仍面临挑战,常导致失败。这主要源于传统停车方法采用多阶段方法,缺乏对整个停车问题的联合优化能力。端到端方法实现了感知和规划模块之间的联合优化,消除误差累积,提升了在极端场景中的算法性能。虽然有多种端到端停车方法使用模仿或强化学习,但前者受数据成本和分布覆盖限制,后者则受效率低下的问题困扰。为此,我们提出了强化学习端到端自主停车方法(REAP)。REAP 在非对称强化学习框架中采用 Soft Actor-Critic(SAC),以提高训练效率和推理性能。为加速模型收敛,我们通过行为克隆将基于规则的规划器的能力蒸馏到端到端网络中。我们进一步引入软预测碰撞惩罚机制,通过惩罚接近障碍物的动作来降低碰撞率。为确保训练好的强化学习网络能直接传输到真实场景,我们建立了 Real2Sim2Real 模拟器。在 Real2Sim 步骤中,我们使用 3D 高斯溶解(3DGS)将真实场景转换为数字场景。在 Sim2Real 步骤中,我们将端到端模型部署到车辆上以弥合 Sim2Real 差距。训练于 3DGS 模拟器并部署于物理车辆上的 REAP 成功在各种类型的停车场中完成停车,尤其在极窄的机械停车位中证明了端到端强化学习停车的可行性。
关键词
引用
@article{arxiv.2605.08713,
title = {REAP: Reinforcement-Learning End-to-End Autonomous Parking with Gaussian Splatting Simulator for Real2Sim2Real Transfer},
author = {Changze Li and Zhe Chen and Shaoyu Chen and Lisen Mu and Yijian Li and Yuelong Yu and Qian Zhang and Qing Su and Ming Yang and Tong Qin},
journal= {arXiv preprint arXiv:2605.08713},
year = {2026}
}