中文

用于可扩展且多功能 3D 生成的结构化 3D 潜在表示

计算机视觉与模式识别 2025-06-02 v3

摘要

我们介绍一种用于 versatile and high-quality 3D 资产创建的新方法。其核心是统一的结构化潜在表示(SLAT),该表示允许解码为不同的输出格式,如辐射场、3D 高斯和网格。通过将稀疏填充的 3D 网格与来自强大视觉基础模型提取的密集多视角视觉特征相集成,来 comprehensively 捕获几何(结构)和纹理(外观)信息,同时在解码期间保持灵活性。我们采用为 SLAT 量身定制的稀疏流变换 transformer 作为 3D 生成模型,并在规模为 20 亿参数的大型 3D 资产数据集(包含 50 万个多样化对象)上进行训练。我们的模型在文本或图像条件下生成高质量结果,显著优于规模相似的现有方法。我们展示了灵活的输出格式选择和局部 3D 编辑功能,这些功能是以前模型所不具备的。将发布代码、模型和数据。

关键词

引用

@article{arxiv.2412.01506,
  title  = {Structured 3D Latents for Scalable and Versatile 3D Generation},
  author = {Jianfeng Xiang and Zelong Lv and Sicheng Xu and Yu Deng and Ruicheng Wang and Bowen Zhang and Dong Chen and Xin Tong and Jiaolong Yang},
  journal= {arXiv preprint arXiv:2412.01506},
  year   = {2025}
}

备注

Project Page: https://github.com/Microsoft/TRELLIS