ColaVLA:利用认知潜空间推理进行自动驾驶中的分层并行轨迹规划
计算机视觉与模式识别
2026-03-02 v3
摘要
自动驾驶需要从复杂的多模态输入中生成安全可靠的轨迹。传统的模块化流水线将感知、预测和规划分离,而近期的端到端(E2E)系统将它们联合学习。视觉语言模型(VLM)通过引入跨模态先验和常识推理进一步丰富了这一范式,然而当前基于 VLM 的规划器面临三个关键挑战: 离散文本推理与连续控制之间的失配, 自回归思维链解码导致的高延迟,以及 限制实时部署的低效或非因果规划器。我们提出 ColaVLA,一个统一的视觉-语言-动作框架,将推理从文本转移到统一的潜空间,并将其与一个分层并行轨迹解码器耦合。认知潜空间推理器通过自适应选择和仅两次 VLM 前向传播,将场景理解压缩为紧凑的、面向决策的元动作嵌入。分层并行规划器随后在单次前向传播中生成多尺度、因果一致的轨迹。这些组件共同保留了 VLM 的泛化性和可解释性,同时实现了高效、准确且安全的轨迹生成。在 nuScenes 基准上的实验表明,ColaVLA 在开环和闭环设置中均实现了 SOTA 性能,并具有良好的效率和鲁棒性。
关键词
引用
@article{arxiv.2512.22939,
title = {ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving},
author = {Qihang Peng and Xuesong Chen and Chenye Yang and Shaoshuai Shi and Hongsheng Li},
journal= {arXiv preprint arXiv:2512.22939},
year = {2026}
}
备注
CVPR2026(Main Conference). Project page: https://pqh22.github.io/projects/ColaVLA/index.html