HiST-VLA:面向端到端自动驾驶的层次时空视觉语言-动作模型
计算机视觉与模式识别
2026-02-17 v1 人工智能
机器人学
摘要
视觉语言-动作(VLA)模型为自动驾驶提供了具有前景潜能的多模态理解能力。然而,其在安全关键场景中的利用受到局限,包括数值推理不准确、3D 空间感知薄弱以及对上下文高度敏感等内在限制。为此,我们提出 HiST-VLA,一个 novel 的层次时空 VLA 模型,用于可靠的轨迹生成。我们的框架通过整合几何感知与细粒度驾驶指令以及状态历史提示,增强了 3D 空间和时序推理。为确保计算效率,我们将动态 token 稀疏化集成到 VLA 架构中。该方法而非过滤冗余 token,而是将其融合,从而在不牺牲模型性能的情况下有效减少冗余。此外,我们采用基于层次变压器的规划器逐步细化粗糙的 VLA 路标为细粒度轨迹。关键在于,规划器利用动态潜在正则化纳入语言指令,确保严格的空间锚定和时序一致性。广泛的在 NAVSIM v2 基准上的评估显示,实现了 Navtest 上最先进的性能,EPDMS 为 88.6,在伪闭环 Navhard 基准上 EPDMS 为 50.9。
引用
@article{arxiv.2602.13329,
title = {HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving},
author = {Yiru Wang and Zichong Gu and Yu Gao and Anqing Jiang and Zhigang Sun and Shuo Wang and Yuwen Heng and Hao Sun},
journal= {arXiv preprint arXiv:2602.13329},
year = {2026}
}