中文

FROST-Drive:基于冻结视觉编码器的可扩展高效端到端驾驶

计算机视觉与模式识别 2026-01-08 v1 人工智能

摘要

端到端(E2E)模型在自动驾驶领域旨在直接将传感器输入映射到控制指令,但其在新型复杂场景下的泛化能力仍是关键挑战。常见的做法是对视觉编码器在驾驶数据集上进行全参数微调,这可能因模型过度依赖训练数据而限制其泛化能力。本文挑战了这一训练范式的必要性。我们提出了 FROST-Drive,一种新颖的 E2E 架构,旨在保留并利用来自视觉语言模型(VLM)的预训练视觉编码器所具备的强大泛化能力。通过保持编码器权重冻结,我们的方法直接将来自 VLM 的丰富、广泛的世界知识传递到驾驶任务中。我们的模型架构将该冻结编码器与基于 Transformer 的多模态融合适配器相结合,并使用基于 GRU 的解码器生成平滑的 waypoint。此外,我们引入了旨在直接优化评估反馈分数(Rater Feedback Score, RFS)的自定义损失函数,该指标优先考虑鲁棒的轨迹规划。我们在 Waymo Open E2E 数据集上进行了大量实验,该数据集专为捕捉长尾场景而精心策划,实验结果表明,我们的冻结编码器方法显著优于采用全参数微调的模型。我们的结果为保留强大 VLM 广泛知识、比花费大量资源进行领域特定适应更有效地实现稳健、可泛化驾驶性能提供了有力证据。这为开发能够更好处理现实应用领域复杂性的基于视觉的模型提供了新的路径。

关键词

引用

@article{arxiv.2601.03460,
  title  = {FROST-Drive: Scalable and Efficient End-to-End Driving with a Frozen Vision Encoder},
  author = {Zeyu Dong and Yimin Zhu and Yu Wu and Yu Sun},
  journal= {arXiv preprint arXiv:2601.03460},
  year   = {2026}
}