中文

PRIX:从原始像素学习规划用于端到端自动驾驶

计算机视觉与模式识别 2026-04-14 v3 人工智能 机器学习 机器人学

摘要

尽管端到端自动驾驶模型显示出有前景的成果,但其实际部署往往受到大型模型规模、对高成本激光雷达传感器的依赖,以及计算密集型 BEV 特征表示的限制。这会限制其在仅具备摄像头的大众车辆中的可扩展性。为此,我们提出了 PRIX (Plan from Raw Pixels)。我们提出了一种新颖且高效的端到端驾驶架构,仅使用摄像头数据,无需显式的 BEV 表示,也无需激光雷达。PRIX 利用视觉特征提取器配合生成式规划头,直接从原始像素输入预测安全轨迹。我们架构的核心组件是情境感知重校准转换器 (CaRT),这是一种新颖的模块,旨在有效增强多层级视觉特征,以实现更稳健的规划。我们通过在 NavSim 和 nuScenes 基准测试中进行全面实验,证明 PRIX 实现了最先进的性能,能够在推理速度和模型规模方面显著高效,同时匹配基于更大规模多模态扩散规划器的能力,这使其成为实际部署的实用解决方案。我们的工作是开源的,代码将置于 https://maxiuw.github.io/prix。

关键词

引用

@article{arxiv.2507.17596,
  title  = {PRIX: Learning to Plan from Raw Pixels for End-to-End Autonomous Driving},
  author = {Maciej K. Wozniak and Lianhang Liu and Yixi Cai and Patric Jensfelt},
  journal= {arXiv preprint arXiv:2507.17596},
  year   = {2026}
}

备注

Accepted for Robotics and Automation Letters (RA-L) and will be presented at iROS 2026