中文

SparseOccVLA:稀疏查询桥接占据感知与视觉语言模型,实现统一的 4D 场景理解与规划

计算机视觉与模式识别 2026-01-21 v2 人工智能

摘要

在自动驾驶领域,视觉语言模型 (VLM) 擅长高层次推理,而语义占据提供细粒度细节。尽管单一范畴取得显著进展,但尚无方法能有效整合二者。常规 VLM 在 token 爆炸与时空推理方面受限,而语义占据提供统一且显式的空间表征,却因稀疏性难以高效与 VLM 集成。为此,我们提出 SparseOccVLA,一种新型视觉-语言-动作模型,统一场景理解、占据预测与轨迹规划,由稀疏占据查询驱动。首先,轻量化稀疏占据编码器生成紧凑且信息丰富的稀疏占据查询,作为视觉与语言之间的唯一桥梁。这些查询映射至语言空间,由 LLM 推理,实现统一的场景理解与未来占据预测。进一步,我们引入 LLM 引导的 Anchor-Diffusion 规划器,具备解耦锚点评分与去噪,以及跨模型轨迹条件融合。SparseOccVLA 在 OmniDrive-nuScenes 上相较于 SOTA 提升 7% CIDEr,在 Occ3D-nuScenes 上 mIoU 提升 0.5,在 nuScenes 基准上实现开放式规划指标 SOTA,彰显其强大的整体能力。

关键词

引用

@article{arxiv.2601.06474,
  title  = {SparseOccVLA: Bridging Occupancy and Vision-Language Models via Sparse Queries for Unified 4D Scene Understanding and Planning},
  author = {Chenxu Dang and Jie Wang and Guang Li and Zhiwen Hou and Zihan You and Hangjun Ye and Jie Ma and Long Chen and Yan Wang},
  journal= {arXiv preprint arXiv:2601.06474},
  year   = {2026}
}