从一个到多个:面向 3D 生成的情境性部件潜在表示
计算机视觉与模式识别
2025-10-31 v2
摘要
近期的 3D 生成进步从多视图 2D 渲染方法转向利用地面实验数据中几何先验的 3D 原生潜在扩散框架。尽管已取得进展,但仍存在三个关键局限性:(1) 单潜在表示难以捕捉复杂的多部件几何,导致细节退化;(2) 整体潜在编码忽略了对组成设计至关重要的部件独立性和相互关系;(3) 全局条件机制缺乏细粒度的可控性。鼓励人类 3D 设计工作流程,我们提出 CoPart - 一个基于部件的扩散框架,将 3D 对象分解为情境性部件潜在表示,以实现连贯的多部件生成。该范式提供了三项优势:i) 通过部件分解降低编码复杂度;ii) 使部件关系建模成为可能;iii) 支持部件级条件控制。我们进一步开发了互动引导策略,用于微调预训练的扩散模型以实现联合部件潜在去噪,确保几何连贯性和基础模型先验。为实现大规模训练,我们构建了 Partverse - 一个从 Objaverse 通过自动网格分割和人工验证注释中派生的新型 3D 部件数据集。广泛的实验表明,CoPart 在部件级编辑、关节对象生成和场景组合方面具有卓越的能力,实现了前所未有的可控性。
引用
@article{arxiv.2507.08772,
title = {From One to More: Contextual Part Latents for 3D Generation},
author = {Shaocong Dong and Lihe Ding and Xiao Chen and Yaokun Li and Yuxin Wang and Yucheng Wang and Qi Wang and Jaehyeok Kim and Chenjian Gao and Zhanpeng Huang and Zibin Wang and Tianfan Xue and Dan Xu},
journal= {arXiv preprint arXiv:2507.08772},
year = {2025}
}
备注
Project page: https://copart3d.github.io/