TAR3D:通过后续部件预测创建高质量3D资产
计算机视觉与模式识别
2025-08-12 v3
摘要
我们提出了TAR3D,一个新型框架,包括3D感知的向量量化变分自编码器(VQ-VAE)和生成式预训练转换器(GPT),用于生成高质量的3D资产。本工作的核心洞见是将多模态统一和有前景的学习能力迁移到条件3D对象生成中。为此,3D VQ-VAE首先将广泛的3D形状编码到紧凑的三平面潜在空间中,并利用一组来自可训练码本的离散表示来重构在查询点占据率监督下的细粒度几何形状。然后,3D GPT配备了称为TriPE的自定义三平面位置嵌入,通过预填充提示标记的自回归方式预测码本索引序列,以便按部就班地建模3D几何形状的组成。在ShapeNet和Objaverse上的大量实验表明,TAR3D在文本到3D和图像到3D任务中能够优于现有方法,实现卓越的生成质量。
引用
@article{arxiv.2412.16919,
title = {TAR3D: Creating High-Quality 3D Assets via Next-Part Prediction},
author = {Xuying Zhang and Yutong Liu and Yangguang Li and Renrui Zhang and Yufei Liu and Kai Wang and Wanli Ouyang and Zhiwei Xiong and Peng Gao and Qibin Hou and Ming-Ming Cheng},
journal= {arXiv preprint arXiv:2412.16919},
year = {2025}
}
备注
Accepted at ICCV 2025. Project page: https://github.com/HVision-NKU/TAR3D