Sharp-It:一种用于 3D 合成与操作的多视角到多视角扩散模型
计算机视觉与模式识别
2024-12-04 v1 机器学习
摘要
文本到图像扩散模型的进步导致了在快速创建 3D 内容方面取得了显著进展。常见的方法是生成物体的一组多视角图像,然后将其重建为 3D 模型。然而,这种方法绕过了对物体本体 3D 表示的使用,容易产生几何瑕疵,且在可控性和操作能力方面受限。另一种方法是直接产生 3D 表示的本体 3D 生成模型,但这些模型通常在分辨率上受限,导致 3D 物体质量较低。本文我们在直接生成 3D 表示的方法与从多视角图像重建 3D 对象的两种方法之间架起了质量差距的桥梁。我们引入一种称为 Sharp-It 的多视角到多视角扩散模型,它接受从低质量物体渲染的 3D 一致的多视角图像集合,并丰富其几何细节和纹理。该扩散模型并行地在多视角集合上运行,即在生成的各视角之间共享特征。然后可以从丰富后的多视角集合中重建出高质量的 3D 模型。通过利用 2D 方法和 3D 方法的优势,我们的方法提供了一种高质量 3D 内容创建的有效且可控的方法。我们展示,Sharp-It 使各种 3D 应用得以实现,包括快速合成、编辑和受控生成,同时实现了高质量资产。
引用
@article{arxiv.2412.02631,
title = {Sharp-It: A Multi-view to Multi-view Diffusion Model for 3D Synthesis and Manipulation},
author = {Yiftach Edelstein and Or Patashnik and Dana Cohen-Bar and Lihi Zelnik-Manor},
journal= {arXiv preprint arXiv:2412.02631},
year = {2024}
}
备注
Project page at https://yiftachede.github.io/Sharp-It/