中文

SuperVoxelGPT:用于自回归形状生成的自适应有序 3D 标记化

计算机视觉与模式识别 2026-05-29 v1 图形学

摘要

自回归多模态大语言模型 (Multimodal Large Language Model, MLLM) 使 3D 生成成为可能,但由于不充分的 3D 标记化方法,难以扩展到高分辨率形状。紧凑的基于集合的表示丢弃了确定性的空间排序,导致序列预测模糊不清;而均匀或八叉树基于体素的网格保留了排序,但造成严重的冗余和过长的序列。这种结构权衡限制了稳定且高效的自回归 3D 生成。我们提出了 SuperVoxelGPT,一个以表示为导向的框架,通过自适应和确定性有序超体素标记化解决了这种张力。在给定提示后,我们首先预测粗糙的几何显著性分布,并使用显著性引导的质心 Voronoi tessellation 构建形状自适应的超体素分区,为复杂区域分配细小单元格,为平滑区域分配较大的单元格。基于文本和有序超体素布局,我们引入 SuperVoxelVAE 并微调预训练的 MLLM 以自回归方式生成超体素标记。在 Trellis-500K 数据集上的实验表明,SuperVoxelGPT 将标记序列长度为统一体素标记化的 12.8%,同时实现了最先进的生成质量和平均 10 倍的加速。

关键词

引用

@article{arxiv.2605.29655,
  title  = {SuperVoxelGPT: Adaptive and Ordered 3D Tokenization for Autoregressive Shape Generation},
  author = {Yuan Li and Congyi Zhang and Xifeng Gao and Xiaohu Guo},
  journal= {arXiv preprint arXiv:2605.29655},
  year   = {2026}
}