利用可控多视角编辑的通用 3D 扩散适配器
计算机视觉与模式识别
2024-03-20 v2 图形学
摘要
由于数据有限且计算复杂度较高,开放域 3D 对象合成落后于图像合成。为缩小这一差距,近期工作研究了多视角扩散,但在 3D 一致性、视觉质量或效率方面常显不足。本文提出 MVEdit,其作为 SDEdit 的 3D 对应方法,采用祖先采样联合对多视角图像去噪并输出高质量纹理网格。MVEdit 基于现成的 2D 扩散模型,通过免训练的 3D Adapter 实现 3D 一致性:将最后时间步的 2D 视角提升为连贯的 3D 表示,再利用渲染视图对下一时间步的 2D 视角进行条件约束,且不牺牲视觉质量。该框架推理仅需 2-5 分钟,在质量与速度间取得比分数蒸馏更优的平衡。MVEdit 高度通用且可扩展,广泛适用于文本/图像到 3D 生成、3D 到 3D 编辑及高质量纹理合成等任务。评估表明,其在图像到 3D 与文本引导纹理生成任务中均达到 SOTA 性能。此外,我们引入一种在资源有限的小型 3D 数据集上微调 2D 潜在扩散模型的方法,实现快速低分辨率文本到 3D 初始化。
引用
@article{arxiv.2403.12032,
title = {Generic 3D Diffusion Adapter Using Controlled Multi-View Editing},
author = {Hansheng Chen and Ruoxi Shi and Yulin Liu and Bokui Shen and Jiayuan Gu and Gordon Wetzstein and Hao Su and Leonidas Guibas},
journal= {arXiv preprint arXiv:2403.12032},
year = {2024}
}
备注
V2 note: Fix missing acknowledgements. Project page: https://lakonik.github.io/mvedit