中文

Fast SceneScript:基于多标记预测的高效精准语言基 3D 场景理解

计算机视觉与模式识别 2026-04-01 v3

摘要

近期基于语言模型的感知通用主义方法已通过统一的架构和界面,在包括 3D 场景布局估计和 3D 目标检测在内的众多任务上实现了最先进的结果。然而,这些方法依赖于自回归的下一个标记预测,本质上较慢。本文引入 Fast SceneScript,这是一种 novel 的结构化语言模型,用于准确且高效的 3D 场景理解。我们的方法采用多标记预测(Multi-Token Prediction, MTP),以显著加快推理速度。尽管 MTP 提升了速度,但不可靠的标记预测会显著降低准确率。为筛选不可靠的标记,我们改进自推测解码(Self-Speculative Decoding, SSD)以适用于结构化语言模型,并引入基于置信度的解码(Confidence-Guided Decoding, CGD),并改进了标记可靠性的评分机制。此外,我们设计了一种参数高效的机制,以减少 MTP 的参数开销。大量在合成数据集和真实世界基准测试上的实验表明,Fast SceneScript 在不牺牲准确率的前提下,可在每个解码器推理步骤中生成最高达 9 个标记,仅增加约 7.5%7.5\% 的额外参数。

关键词

引用

@article{arxiv.2512.05597,
  title  = {Fast SceneScript: Fast and Accurate Language-Based 3D Scene Understanding via Multi-Token Prediction},
  author = {Ruihong Yin and Xuepeng Shi and Oleksandr Bailo and Marco Manfredi and Theo Gevers},
  journal= {arXiv preprint arXiv:2512.05597},
  year   = {2026}
}

备注

Accepted to CVPR 2026