中文

STELLAR:面向自动驾驶的 3D 感知大模型扩展

计算机视觉与模式识别 2026-05-21 v1 人工智能 机器学习 机器人学

摘要

模型扩展通过在多样化数据集上进行大规模训练已显示出显著的成功,但是否适用于自动驾驶感知系统仍是一个未解决的问题,由于独特挑战,如融合异构传感器数据和需要精细的 3D 空间理解。为弥合这一差距,我们进行了一项全面研究,系统分析规模对这些系统的影响。我们基于稀疏窗口转换器开发了 STELLAR 模型,通过扩展输入模态性包括激光雷达、雷达、摄像头和地图先验。我们在由 500 万参数规模、包含 5000 万驾驶示例的大规模数据集上进行训练。我们的大规模实验揭示了模型性能与模型大小、数据和计算量之间的经验性扩展趋势。 resulting model 在Waymo Open Dataset 挑战中建立了新的最先进水平,显著优于先前的方法。我们的工作表明,大规模训练是推进自动驾驶感知模型能力的极具前景的路径。

关键词

引用

@article{arxiv.2605.20390,
  title  = {STELLAR: Scaling 3D Perception Large Models for Autonomous Driving},
  author = {Yingwei Li and Xin Huang and Yang Liu and Yang Fu and Alex Zihao Zhu and Chen Song and Junwen Yao and Anant Subramanian and Hao Xiang and Weijing Shi and Yuliang Zou and Tom Hoddes and Zhaoqi Leng and Govind Thattai and Dragomir Anguelov and Mingxing Tan},
  journal= {arXiv preprint arXiv:2605.20390},
  year   = {2026}
}