中文

512 字节的 3D 表示:变分词元化是自回归 3D 生成的关键

计算机视觉与模式识别 2024-12-04 v1

摘要

自回归变换器已彻底革新了高保真图像生成。其中一个关键要素在于词元化器,它将高分辨率图像块压缩到适合大型语言模型的离散标记集合中,采用扫描或层次顺序。将这些词元化器扩展到 3D 生成却 presents a significant挑战:与自然呈现空间序列和多尺度关系的图像块不同,3D 数据缺乏内在顺序,导致难以在保持结构细节的同时压缩到更少的标记。为此,我们引入变分词元化器(VAT),将无序的 3D 数据转换为具有隐式层次结构的紧凑潜在标记,适用于高效且高保真的粗到细自回归建模。VAT 首先通过情境变换器,将大量无序的 3D 特征压缩到最小信息损失的标记集合中。该潜在空间随后映射到高斯分布,用于残差量化,标记数随尺度逐渐增加。如此一来,不同尺度的标记自然通过分配到同一高斯分布中的不同子空间来建立相互关联,促进跨尺度标记关系的离散建模。在解码阶段,利用高分辨率三平面将这些紧凑潜在标记转换为详细的 3D 形状。大量实验表明,VAT 使 3D 生成能够实现可扩展且高效, 在质量、效率和泛化性方面均优于现有方法。显著的是,VAT 实现了最高可达 250 倍的压缩,将 1MB 的网格压缩至仅 3.9KB 且 96% F 分数,进一步可压缩至 256 个 int8 标记,实现 2000 倍的压缩,同时保持 92% F 分数。

关键词

引用

@article{arxiv.2412.02202,
  title  = {3D representation in 512-Byte:Variational tokenizer is the key for autoregressive 3D generation},
  author = {Jinzhi Zhang and Feng Xiong and Mu Xu},
  journal= {arXiv preprint arXiv:2412.02202},
  year   = {2024}
}

备注

22 pages, 21 figures