Isotropic3D:基于单一 CLIP 嵌入的图像到三维生成
计算机视觉与模式识别
2024-03-18 v1 机器学习
摘要
在预训练二维扩散模型日益普及的推动下,利用分数蒸馏采样 (SDS) 的图像到三维生成正取得显著进展。大多数现有方法结合了二维扩散模型的新视图提升(通常将参考图像作为条件),同时在参考视图处应用硬 L2 图像监督。然而,严重依赖图像容易破坏二维扩散模型的归纳知识,频繁导致平坦或扭曲的三维生成。在这项工作中,我们以一种新颖的视角重新审视图像到三维生成,并提出了 Isotropic3D,一种仅将图像 CLIP 嵌入作为输入的图像到三维生成流水线。Isotropic3D 仅依靠 SDS 损失,允许优化相对于方位角是各向同性的。我们框架的核心在于两阶段扩散模型微调。首先,我们通过将文本编码器替换为图像编码器来微调文本到三维扩散模型,使模型初步获得图像到图像的能力。其次,我们使用我们的显式多视图注意力 (EMA) 进行微调,该注意力将有噪声的多视图图像与无噪声的参考图像结合作为显式条件。CLIP 嵌入在整个过程中被发送到扩散模型,而参考图像在微调后即被丢弃。因此,仅凭单一图像 CLIP 嵌入,Isotropic3D 能够生成多视图相互一致的图像,以及与现有图像到三维方法相比具有更对称和整洁的内容、比例匀称的几何形状、丰富彩色纹理且更少扭曲的三维模型,同时在很大程度上保持与参考图像的相似性。项目页面位于 https://isotropic3d.github.io/。代码和模型位于 https://github.com/pkunliu/Isotropic3D。
引用
@article{arxiv.2403.10395,
title = {Isotropic3D: Image-to-3D Generation Based on a Single CLIP Embedding},
author = {Pengkun Liu and Yikai Wang and Fuchun Sun and Jiafang Li and Hang Xiao and Hongxiang Xue and Xinzhou Wang},
journal= {arXiv preprint arXiv:2403.10395},
year = {2024}
}
备注
Project page: https://isotropic3d.github.io/ Source code: https://github.com/pkunliu/Isotropic3D