中文

DriveTok:面向统一多视角重建与理解的3D驾驶场景分词

计算机视觉与模式识别 2026-03-20 v1 机器学习

摘要

随着视觉-语言-动作模型和世界模型在自动驾驶系统中的广泛应用,高效的图像分词作为视觉模态的接口变得至关重要。然而,大多数现有分词器设计用于单目和2D场景,在应用于高分辨率多视角驾驶场景时会导致效率低下和视角不一致。为此,我们提出了DriveTok,一种用于统一多视角重建和理解的高效3D驾驶场景分词器。DriveTok首先从视觉基础模型获取语义丰富的视觉特征,然后通过3D可变形注意力将其转换为场景分词。对于解码,我们采用多视角变换器从场景分词重建多视角特征,并使用多个注意力头获取RGB、深度和语义重建。我们还在场景分词上直接添加一个3D注意力头,用于3D语义占据预测,以实现更好的空间感知。通过多任务训练目标,DriveTok学习了集成语义、几何和纹理信息的统一场景分词,以实现高效的多视角分词。在广泛使用的nuScenes数据集上进行的大量实验表明,DriveTok提取的场景分词在图像重建、语义分割、深度预测和3D占据预测等任务上表现优异。

关键词

引用

@article{arxiv.2603.19219,
  title  = {DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding},
  author = {Dong Zhuo and Wenzhao Zheng and Sicheng Zuo and Siming Yan and Lu Hou and Jie Zhou and Jiwen Lu},
  journal= {arXiv preprint arXiv:2603.19219},
  year   = {2026}
}

备注

Project Page: https://paryi555.github.io/DriveTok/ Code: https://github.com/paryi555/DriveTok