中文

面向稳健端到端自动驾驶的感知增强型世界感知-行动模型 (Percept-WAM)

计算机视觉与模式识别 2025-12-01 v1 机器人学

摘要

自动驾驶严重依赖准确且稳健的空间感知。许多故障源于感知不准确和不稳定,尤其是在长尾场景和复杂互动中。然而,当前的视觉语言模型在空间定位和理解方面较弱,基于它们的 VLA 系统因此表现出受限的感知和定位能力。为此,我们引入了 Percept-WAM,一款感知增强型世界感知-行动模型,是首个在单个视觉语言模型 (VLM) 中隐式集成 2D/3D 场景理解能力的模型。我们不依赖基于 QA 风格的空间推理,而是将 2D/3D 感知任务统一为 World-PV 和 World-BEV 标记,这些标记编码了空间坐标和置信度。我们提出了基于网格条件的预测机制,用于密集对象感知,包含 IoU 感知评分和并行自回归解码,提高了在长尾、远距离和小目标场景中的稳定性。此外,Percept-WAM 利用预训练的 VLM 参数保留通用智能(例如逻辑推理),并可直接输出感知结果和轨迹控制输出。实验表明,Percept-WAM 在下游感知基准测试中与经典检测器和分割器持平或更优,实现了 COCO 2D 检测和 nuScenes BEV 3D 检测的 51.7/58.9 mAP。当与轨迹解码器集成时,进一步提升了在 nuScenes 和 NAVSIM 上的规划性能,例如在 NAVSIM 上 PMDS 提升 2.1。定性结果进一步突显了其强大的开放词汇和长尾泛化能力。

关键词

引用

@article{arxiv.2511.19221,
  title  = {Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving},
  author = {Jianhua Han and Meng Tian and Jiangtong Zhu and Fan He and Huixin Zhang and Sitong Guo and Dechang Zhu and Hao Tang and Pei Xu and Yuze Guo and Minzhe Niu and Haojie Zhu and Qichao Dong and Xuechao Yan and Siyuan Dong and Lu Hou and Qingqiu Huang and Xiaosong Jia and Hang Xu},
  journal= {arXiv preprint arXiv:2511.19221},
  year   = {2025}
}