基于解缠纹理与形状多视角扩散的类别感知3D对象组合
计算机视觉与模式识别
2025-09-03 v1
摘要
本文提出了一种新的3D对象合成方法,即将3D模型与另一对象类别进行组合以创建新3D模型。然而,现有的大多数基于文本/图像/3D到3D的方法难以有效整合多个内容来源,常导致纹理不一致和形状不准。为此,我们提出了一种简单却强大的方法——类别+3D到3D(C33D),用于生成新颖且结构连贯的3D模型。该方法首先从输入3D模型渲染出多视角图像和法线图,然后将前视图像和来自另一对象类别的文本描述作为输入,通过自适应文本图像和谐(ATIH)生成新颖的2D对象。为确保纹理一致性,我们引入纹理多视角扩散,该技术基于新生成的2D对象对剩余多视角RGB图像的纹理进行细化。为了提高形状精度,我们提出形状多视角扩散,以新生成的2D对象为条件,对多视角RGB图像和法线图的2D形状进行改进。最后,这些输出用于重建完整且新颖的3D模型。广泛的实验表明,我们的方法有效,生成的3D作品令人印象深刻,如图1第一行所示的shark(3D)-crocodile(text)。项目页面地址:https://xzr52.github.io/C33D/
引用
@article{arxiv.2509.02357,
title = {Category-Aware 3D Object Composition with Disentangled Texture and Shape Multi-view Diffusion},
author = {Zeren Xiong and Zikun Chen and Zedong Zhang and Xiang Li and Ying Tai and Jian Yang and Jun Li},
journal= {arXiv preprint arXiv:2509.02357},
year = {2025}
}
备注
Accepted to ACM Multimedia 2025