GSDrive:利用3D高斯溅射环境进行多模态未来轨迹探测以强化驾驶策略
机器人学
2026-05-18 v3
摘要
端到端(E2E)自动驾驶旨在将感官观测直接映射为驾驶动作,但其在真实世界的部署受到不断演变的数据分布和持续标注的高昂成本所阻碍。虽然结合模仿学习(IL)和强化学习(RL)是改进策略的常见策略,但传统的RL训练依赖于延迟的、基于事件的奖励,策略仅从碰撞等灾难性结果中学习,导致过早收敛到次优行为。为了解决这些局限性,我们提出了GSDrive,这是一个利用可微3D高斯溅射(3DGS)环境在E2E驾驶中进行未来感知轨迹探测和奖励塑形的框架。GSDrive首先通过IL学习一个多模态轨迹探测器,然后使用RL在3DGS环境中评估多个候选未来,将其模拟回报转换为密集的塑形奖励,用于策略优化。这产生了一个循环的混合IL-RL训练循环,其中IL提供结构化的未来先验,RL提供交互式反馈以进行迭代优化。在重建的nuScenes数据集上评估,我们的方法在闭环实验中优于其他基于模拟的RL方法。代码可在https://github.com/ZionGo6/GSDrive获取。
引用
@article{arxiv.2604.28111,
title = {GSDrive: Reinforcing Driving Policies by Multi-mode Future Trajectory Probing with 3D Gaussian Splatting Environment},
author = {Ziang Guo and Chen Min and Xuefeng Zhang and Yixiao Zhou and Shuo Wang and Sifa Zheng and Dzmitry Tsetserukou and Zufeng Zhang},
journal= {arXiv preprint arXiv:2604.28111},
year = {2026}
}
备注
2nd version