TV-3DG:利用视觉提示掌握文本到三维定制化生成
计算机视觉与模式识别
2024-11-01 v2
摘要
近年来,生成模型的进步显著扩展了文本到三维生成的能力。许多方法依赖于得分蒸馏采样(SDS)技术。然而,在定制化生成任务中,SDS 难以适应文本和视觉提示等多条件输入。为探究其核心原因,我们将 SDS 分解为差分项和无分类器引导项。我们的分析指出,核心问题源于差分项以及优化过程中的随机噪声添加,这两者都导致蒸馏过程中偏离目标模式。为解决此问题,我们提出了一种新颖的算法——分类器得分匹配(CSM),该算法移除了 SDS 中的差分项,并采用确定性噪声添加过程以减少优化过程中的噪声,从而在我们的定制化生成框架中有效克服了 SDS 的低质量限制。基于 CSM,我们通过注意力融合机制和采样引导技术整合视觉提示信息,形成了视觉提示 CSM(VPCSM)算法。此外,我们引入了一个语义-几何校准(SGC)模块,通过改进文本信息集成来提升质量。我们将所提方法命名为 TV-3DG,大量实验证明了其能够实现稳定、高质量的定制化三维生成。项目页面:\url{https://yjhboy.github.io/TV-3DG}
引用
@article{arxiv.2410.21299,
title = {TV-3DG: Mastering Text-to-3D Customized Generation with Visual Prompt},
author = {Jiahui Yang and Donglin Di and Baorui Ma and Xun Yang and Yongjia Ma and Wenzhang Sun and Wei Chen and Jianxun Cui and Zhou Xue and Meng Wang and Yebin Liu},
journal= {arXiv preprint arXiv:2410.21299},
year = {2024}
}