TrajMoE:基于强化学习的场景自适应轨迹规划混合专家模型
计算机视觉与模式识别
2025-12-10 v2 人工智能
摘要
当前的自动驾驶系统常偏好端到端框架,采用图像等传感器输入,通过神经网络学习映射到轨迹空间。以往的研究表明,提供可能轨迹的先验分布可实现更好的规划性能。然而,这些方法常忽视两个关键方面:1)合适的轨迹先验在不同驾驶情景下差异显著;2)其轨迹评估机制缺乏基于策略的细化,受限于单阶段监督训练的局限。为此,我们在两个关键领域进行了改进。针对问题 1,我们采用混合专家(MoE)对不同情景应用不同的轨迹先验。针对问题 2,我们利用强化学习对轨迹评分机制进行微调。此外,我们整合了不同感知骨干网络以增强感知特征。我们的集成模型在 navsim ICCV 基准测试中取得了 51.08 的分数,位列第三名。
引用
@article{arxiv.2512.07135,
title = {TrajMoE: Scene-Adaptive Trajectory Planning with Mixture of Experts and Reinforcement Learning},
author = {Zebin Xing and Pengxuan Yang and Linbo Wang and Yichen Zhang and Yiming Hu and Yupeng Zheng and Junli Wang and Yinfeng Gao and Guang Li and Kun Ma and Long Chen and Zhongpu Xia and Qichao Zhang and Hangjun Ye and Dongbin Zhao},
journal= {arXiv preprint arXiv:2512.07135},
year = {2025}
}