3D 生成的本土且紧凑的结构化潜在表示
计算机视觉与模式识别
2025-12-17 v1 人工智能
摘要
近期的 3D 生成模型进展显著提升了生成逼真度,但该领域仍受制于现有表示方法,后者难以捕捉复杂拓扑和细致外观的资产。本文提出了一种从原生 3D 数据学习结构化潜在表示的方法,以解决这一挑战。其核心是一种新的稀疏体素结构,称为 O-Voxel,是一种全方位体素表示,编码几何和外观。O-Voxel 能够稳健地建模任意拓扑,包括开放式、非流形以及完全封闭表面,同时捕捉纹理颜色之外的全面表面属性,如基于物理的渲染参数。基于 O-Voxel,我们设计了稀疏压缩变分自编码器(Sparse Compression VAE),提供高的空间压缩率和紧凑的潜在空间。我们使用多样化的公开 3D 资产数据集训练了由 4B 参数组成的大规模流匹配模型进行 3D 生成。尽管规模庞大,推理仍高度高效。此外,我们生成的几何和材料质量远超现有模型。我们认为我们的做法为 3D 生成建模带来了重大进展。
关键词
引用
@article{arxiv.2512.14692,
title = {Native and Compact Structured Latents for 3D Generation},
author = {Jianfeng Xiang and Xiaoxue Chen and Sicheng Xu and Ruicheng Wang and Zelong Lv and Yu Deng and Hongyuan Zhu and Yue Dong and Hao Zhao and Nicholas Jing Yuan and Jiaolong Yang},
journal= {arXiv preprint arXiv:2512.14692},
year = {2025}
}
备注
Project Page: https://microsoft.github.io/TRELLIS.2/