中文

LaST-VLA:面向自动驾驶的潜在时空空间思考范式

计算机视觉与模式识别 2026-03-13 v2

摘要

虽然视觉语言动作(Vision-Language-Action, VLA)模型通过统一感知与规划领取了自动驾驶领域的革命,其依赖显式文本链式思维(Chain-of-Thought, CoT)导致语义-感知解耦及感知-符号冲突。近期向潜在推理范式的转变试图通过在连续隐藏空间中思考来规避这些瓶颈,但缺乏显式中间约束,使标准潜在CoT常常以一种不依赖物理的表示运行。为此,我们提出潜在时空VLA框架(Latent Spatio-Temporal VLA, LaST-VLA),将推理范式从离散符号处理转向物理导向的潜在时空CoT。通过实现双特征对齐机制,我们直接从3D基础模型中提炼几何约束,从世界模型中提取动态预见,并注入潜在空间。结合从特征对齐到轨迹生成的渐进式SFT训练策略,经强化学习中的群相对政策优化(Group Relative Policy Optimization, GRPO)精炼,以确保安全性和规则合规。\method~在NAVSIM v1(91.3 PDMS)和NAVSIM v2(87.1 EPDMS)上创下新纪录,并在SURDS和NuDynamics基准测试中表现出色,展现出卓越的时空推理能力。

关键词

引用

@article{arxiv.2603.01928,
  title  = {LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving},
  author = {Yuechen Luo and Fang Li and Shaoqing Xu and Yang Ji and Zehan Zhang and Bing Wang and Yuannan Shen and Jianwei Cui and Long Chen and Guang Chen and Hangjun Ye and Zhi-Xin Yang and Fuxi Wen},
  journal= {arXiv preprint arXiv:2603.01928},
  year   = {2026}
}