面向多样化文本到3D生成的流分数蒸馏
机器学习
2024-07-30 v2 人工智能
摘要
文本到3D生成的最新进展取得了显著进步,尤其是通过依赖分数蒸馏采样(SDS)的方法。虽然SDS能够创建令人印象深刻的3D资产,但其固有的最大似然搜索本质限制了生成结果的多样性。本文发现,去噪扩散隐式模型(DDIM)的生成过程(即PF-ODE)可以用SDS损失的类似形式简洁表达。进一步,可以将SDS视为广义的DDIM生成过程。基于这一见解,我们表明噪声添加阶段的噪声采样策略显著限制了生成结果的多样性。为解决这一局限,我们提出了一种创新的噪声采样方法,并引入了一种名为流分数蒸馏(FSD)的新型文本到3D方法。我们在多种文本到图像扩散模型上的验证实验表明,FSD在不牺牲质量的前提下显著增强了生成多样性。
引用
@article{arxiv.2405.10988,
title = {Flow Score Distillation for Diverse Text-to-3D Generation},
author = {Runjie Yan and Kailu Wu and Kaisheng Ma},
journal= {arXiv preprint arXiv:2405.10988},
year = {2024}
}
备注
Consistent Flow Distillation is an improved version of this paper