PODIA-3D:基于姿态保持文本到图像扩散的大域间隙下三维生成模型域适应
计算机视觉与模式识别
2023-04-05 v1 人工智能
摘要
近年来,三维生成模型取得了显著进展,然而跨多样领域训练这些模型具有挑战性,且需要海量训练数据与姿态分布知识。文本引导的域适应方法已允许生成器利用文本提示适配到目标域,从而免去了汇集大量数据的需求。近期,DATID-3D 通过借助文本到图像扩散来利用文本多样性,在文本引导域中呈现出令人印象深刻的样本质量。然而,由于当前文本到图像扩散模型存在以下问题:1) 基于扩散的翻译中形状-姿态权衡,2) 姿态偏置,以及 3) 目标域中的实例偏置,将三维生成器适应到与源域存在显著域间隙的域仍然具有挑战性,导致生成样本的三维形状较差、文本-图像对应性低以及域内多样性低。为解决这些问题,我们提出了一种称为 PODIA-3D 的新流程,其使用基于姿态保持文本到图像扩散的三维生成模型域适应。我们构建了姿态保持文本到图像扩散模型,允许使用极高层级噪声以实现显著域变化。我们还提出了从专用到通用的采样策略以改善生成样本的细节。此外,为克服实例偏置,我们引入了文本引导去偏方法以提升域内多样性。因此,我们的方法成功地将三维生成器适应到显著域间隙下。我们的定性结果与用户研究表明,我们的方法在文本-图像对应性、真实感、渲染图像多样性以及生成样本中三维形状的深度感方面优于现有的三维文本引导域适应方法。
引用
@article{arxiv.2304.01900,
title = {PODIA-3D: Domain Adaptation of 3D Generative Model Across Large Domain Gap Using Pose-Preserved Text-to-Image Diffusion},
author = {Gwanghyun Kim and Ji Ha Jang and Se Young Chun},
journal= {arXiv preprint arXiv:2304.01900},
year = {2023}
}
备注
Project page: https://gwang-kim.github.io/podia_3d/