UniLat3D:面向单阶段3D生成的几何-外观统一潜在表示
计算机视觉与模式识别
2025-09-30 v1 人工智能
图形学
摘要
高保真度3D资产生成对各行业至为重要。虽然近期的3D预训练模型在生成逼真内容方面显示出强大能力,但大多数基于扩散模型,遵循两阶段管道:首先生成几何,再合成外观。这种解耦设计倾向于产生几何-纹理错位和不可忽视的成本。在本文中,我们提出UniLat3D,一个将几何和外观编码到单一潜在空间中的统一框架,直接实现单阶段生成。我们的关键贡献是几何-外观统一变分自编码器(Unified VAE),将高分辨率稀疏特征压缩为紧凑的潜在表示——UniLat。UniLat将结构和视觉信息整合到密集的低分辨率潜在表示中,可高效解码为多种3D格式,例如3D高斯和网格。基于这一统一表示,我们训练单个流匹配模型将高斯噪声直接映射到UniLat,消除冗余阶段。仅依托公开数据集训练,UniLat3D能在数秒内从单张图像生成高质量3D资产,实现卓越的外观保真度和几何质量。更多演示与代码请参见:https://unilat3d.github.io/。
引用
@article{arxiv.2509.25079,
title = {UniLat3D: Geometry-Appearance Unified Latents for Single-Stage 3D Generation},
author = {Guanjun Wu and Jiemin Fang and Chen Yang and Sikuang Li and Taoran Yi and Jia Lu and Zanwei Zhou and Jiazhong Cen and Lingxi Xie and Xiaopeng Zhang and Wei Wei and Wenyu Liu and Xinggang Wang and Qi Tian},
journal= {arXiv preprint arXiv:2509.25079},
year = {2025}
}
备注
Project page: https://unilat3d.github.io/