PartCrafter:基于构成式潜在扩散变换器的结构化3D网格生成
计算机视觉与模式识别
2025-06-09 v1
摘要
我们提出PartCrafter,是首个能够从单张RGB图像联合合成多个语义上有意义且几何上具有差异性3D网格的结构化3D生成模型。与现有方法不同,PartCrafter不依赖预分割的输入,采用统一的构成式生成架构。基于单张图像,同时去噪多个3D部件,实现端到端的部件感知3D生成,既能生成单个物体,也能生成复杂的多物体场景。PartCrafter基于预训练的3D网格扩散变换器(DiT),继承了预训练权重、编码器和解码器,引入了两个关键创新:(1)构成式潜在空间,其中每个3D部件由一组解耦的潜在令牌表示;(2)层次注意力机制,实现单个部件内部和所有部件之间的结构化信息流,确保在生成过程中保持全局一致性,同时保留部件级细节。为支持部件级监督,我们从大规模3D目标数据集中挖掘部件级注释,构建了新数据集。实验表明,PartCrafter在生成可分解的3D网格方面优于现有方法,包括生成输入图像中不可直接可见的部件,展示了部件感知生成先验在3D理解与合成方面的优势。代码和训练数据将公开发布。
引用
@article{arxiv.2506.05573,
title = {PartCrafter: Structured 3D Mesh Generation via Compositional Latent Diffusion Transformers},
author = {Yuchen Lin and Chenguo Lin and Panwang Pan and Honglei Yan and Yiqiang Feng and Yadong Mu and Katerina Fragkiadaki},
journal= {arXiv preprint arXiv:2506.05573},
year = {2025}
}
备注
Project Page: https://wgsxm.github.io/projects/partcrafter/