AppleVLM:基于高级感知与规划增强的端到端自动驾驶
机器人学
2026-02-05 v1 人工智能
摘要
端到端自动驾驶已成为一种引人注目的范式,将感知、决策和控制集成到统一的学习框架中。最近,视觉语言模型 (VLM) 因其潜在增强端到端驾驶模型在多样化且未知情景下鲁棒性和泛化能力而受到广泛关注。然而,现有的 VLM 方法仍面临 lane 感知不佳、语言理解偏见以及难以处理边界情况的挑战。为解决这些问题,我们提出了 AppleVLM,这是一个用于稳健端到端驾驶的高级感知和规划增强 VLM 模型。AppleVLM 引入了新颖的视觉编码器和规划策略编码器,以提高感知和决策能力。首先,视觉编码器通过可变形变换机制融合来自多个时间步跨多个视角图像的时空信息,增强了对相机变化的鲁棒性,促进了在不同车辆平台上的可扩展部署。其次,与传统 VLM 方法不同,AppleVLM 引入了专门的规划模态,对鸟瞰视角空间信息进行编码,缓解了导航指令中的语言偏见。最后,一个通过分层链式思维微调的 VLM 解码器将视觉、语言和规划特征集成,输出稳健的驾驶waypoint。我们在两个 CARLA 框架基准测试中的闭环实验中评估了 AppleVLM,实现了端到端自动驾驶的领先性能。此外,我们将 AppleVLM 部署在 AGV 平台上,成功展示了在复杂户外环境中的端到端自动驾驶。
引用
@article{arxiv.2602.04256,
title = {AppleVLM: End-to-end Autonomous Driving with Advanced Perception and Planning-Enhanced Vision-Language Models},
author = {Yuxuan Han and Kunyuan Wu and Qianyi Shao and Renxiang Xiao and Zilu Wang and Cansen Jiang and Yi Xiao and Liang Hu and Yunjiang Lou},
journal= {arXiv preprint arXiv:2602.04256},
year = {2026}
}