MultiPark: 带有下一片段预测的多模态停车Transformer
机器人学
2025-08-18 v1
摘要
在高度受限空间中准确且安全地停车仍然是一个关键挑战。与结构化驾驶环境不同,停车需要执行复杂操作,如频繁换挡和转向饱和。近期尝试使用模仿学习(IL)进行停车已取得有前景的结果。然而,现有工作忽略了车道自由的开放空间中停车行为的多模态性质,未能在相同情境下推导出多个可行方案。值得注意的是,IL方法存在固有的因果混淆,因此使神经网络跨多样化停车场景泛化尤为困难。为应对这些挑战,我们提出MultiPark,一个用于多模态停车的自回归Transformer。为处理充满急剧转弯点的路径,我们引入了一种数据高效的下一片段预测范式,实现空间泛化和时间外推。此外,我们设计了可学习的停车查询因子化为挡位、纵向和横向分量,并行解码多样化的停车行为。为缓解IL中的因果混淆,我们的方法采用以目标为中心的位姿和以自车为中心的碰撞作为面向结果的目标,应用于所有模态,超越纯模仿损失。在真实世界数据集上的评估表明,MultiPark在多种场景下达到了最先进性能。我们将MultiPark部署到量产车辆上,进一步验证了该方法在真实停车环境中的鲁棒性。
引用
@article{arxiv.2508.11537,
title = {MultiPark: Multimodal Parking Transformer with Next-Segment Prediction},
author = {Han Zheng and Zikang Zhou and Guli Zhang and Zhepei Wang and Kaixuan Wang and Peiliang Li and Shaojie Shen and Ming Yang and Tong Qin},
journal= {arXiv preprint arXiv:2508.11537},
year = {2025}
}