中文

面向端到端驾驶的高效多相机编码方法

计算机视觉与模式识别 2025-12-16 v2

摘要

我们提出了Flex,一个高效且有效的场景编码器,用于解决端到端自动驾驶中处理高容量多相机数据的计算瓶颈。Flex采用一小套可学习的场景令牌,联合编码来自不同相机和时间步的所有图像令牌。在设计上,我们的方法是几何无关的,直接从数据中学习紧凑的场景表示,而不依赖于显式的3D归纳偏置,如鸟瞰图(BEV)、占用或三平面表示,这些在先前的研究中很常见。这种整体编码策略积极压缩了下游大语言模型(LLM)策略模型的视觉输入。在20,000小时驾驶的大规模专有数据集上评估,我们的Flex实现了2.2倍的推理吞吐量提升,同时相比最先进方法大幅提高了驾驶性能。此外,我们证明这些紧凑的场景令牌在没有显式监督的情况下发展出了场景分解的涌现能力。我们的发现挑战了3D先验必要的普遍假设,证明数据驱动的联合编码策略为未来自动驾驶系统提供了更具可扩展性、高效且有效的路径。

关键词

引用

@article{arxiv.2512.10947,
  title  = {Towards Efficient and Effective Multi-Camera Encoding for End-to-End Driving},
  author = {Jiawei Yang and Ziyu Chen and Yurong You and Yan Wang and Yiming Li and Yuxiao Chen and Boyi Li and Boris Ivanovic and Marco Pavone and Yue Wang},
  journal= {arXiv preprint arXiv:2512.10947},
  year   = {2025}
}

备注

Project Page: https://jiawei-yang.github.io/Flex/