中文

MTA-RL:基于多模态 Transformer 的 3D 可供性与强化学习的鲁棒城市驾驶

计算机视觉与模式识别 2026-05-12 v1 人工智能 机器人学

摘要

鲁棒的城市自动驾驶需要在密集交互下实现可靠的 3D 场景理解和稳定的决策。然而,现有的端到端模型缺乏可解释性,而模块化流水线则受到脆弱接口间误差传播的困扰。本文提出了 MTA-RL,这是第一个通过基于多模态 Transformer 的 3D 可供性与强化学习(RL)来桥接感知与控制的框架。与直接回归动作的先前融合模型不同,MTA-RL 使用 Transformer 架构融合 RGB 图像和 LiDAR 点云,以预测显式的、几何感知的可供性表示。这些结构化表示作为紧凑的观察空间,使 RL 策略能够纯粹基于预测的驾驶语义进行操作,这显著提高了样本效率和稳定性。在 CARLA Town01-03 中不同密度(20-60 辆背景车辆)下的广泛评估表明,MTA-RL 始终优于 SOTA 基线。仅在 Town03 上训练,我们的方法在未见过的城镇中表现出卓越的零样本泛化能力,路线完成度提升了 9.0%,总行驶距离提升了 11.0%,每次违规距离提升了 83.7%。此外,消融研究证实我们的多模态融合和奖励塑造是至关重要的,显著优于仅图像和未塑造的变体,证明了 MTA-RL 在鲁棒城市自动驾驶中的有效性。

关键词

引用

@article{arxiv.2605.10177,
  title  = {MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning},
  author = {Guangli Chen and Dianzhao Li and Wenjian Zhong and Bangquan Xie and Ostap Okhrin},
  journal= {arXiv preprint arXiv:2605.10177},
  year   = {2026}
}