场景即标记:面向通用 3D 视觉语言理解的多尺度正态分布变换标记器
计算机视觉与模式识别
2025-11-27 v1
摘要
近期在 3D 视觉语言模型 (VLM) 方面的进展突显了 3D 场景理解和推理的强大潜力。然而,有效地将 3D 场景标记化为整体场景标记,以及在 diverse 3D 理解任务中利用这些标记,仍然高度具有挑战性。我们提出 NDTokenizer3D,一个能够进行 wide range 3D 场景理解任务的通用 3D VLM,同时自然支持人类交互,从而在语言层面的推理与 3D 空间理解之间搭建桥梁。我们方法的核心是基于多尺度正态分布变换 (NDT) 表示构建的三阶段场景标记化管道,搭配多尺度 NDT 解码器 (MSDec)。具体而言,NDTokenizer3D 首先从原始高分辨率点云构建多尺度 NDT 表示,既保留全局语境又保留细粒度几何细节。接下来,MSDec 分阶段融合跨尺度 NDT 特征,产生可供 LLM 端使用的整体场景标记。除了标记化,MSDec 也被改造为人类交互式提示 (点、框、掩码) 和分割掩码解码的通用接口,将 diverse 3D 场景理解任务统一到单个架构中。通过这个紧凑且统一的设计,NDTokenizer3D 提供了一个细粒度、通用 3D VLM,在 3D 指代分割、3D 视觉问答和 3D 密集描述方面实现了显著的性能提升。
引用
@article{arxiv.2511.21191,
title = {Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding},
author = {Yutao Tang and Cheng Zhao and Gaurav Mittal and Rohith Kukkala and Rama Chellappa and Cheng Peng and Mei Chen},
journal= {arXiv preprint arXiv:2511.21191},
year = {2025}
}