ScaleDreamer: 基于异步分数蒸馏的可扩展文本到3D合成
计算机视觉与模式识别
2024-07-03 v1 人工智能
多媒体
摘要
通过利用文本到图像的扩散先验,分数蒸馏可以在没有成对文本-3D训练数据的情况下合成3D内容。最近的研究不再针对每个文本提示进行数小时的在线优化,而是专注于学习一个文本到3D的生成网络,以摊销多个文本-3D关系,从而在几秒钟内合成3D内容。然而,由于难以将预训练的扩散先验与来自各种文本提示的渲染图像的分布对齐,现有的分数蒸馏方法难以扩展到大量的文本提示。当前最先进的方法,如变分分数蒸馏,会微调预训练的扩散模型以最小化噪声预测误差,从而对齐分布,但这种方法训练不稳定,并且会损害模型对大量文本提示的理解能力。基于扩散模型在较早时间步长往往具有较低噪声预测误差的观察,我们提出了异步分数蒸馏(ASD),它通过将扩散时间步长转移到更早的时间步长来最小化噪声预测误差。ASD训练稳定,并且可以扩展到10万个提示。它在不改变预训练扩散模型权重的情况下减少了噪声预测误差,从而保持了其对提示的强大理解能力。我们在不同的2D扩散模型(包括Stable Diffusion和MVDream)以及文本到3D生成器(包括Hyper-iNGP、3DConv-Net和Triplane-Transformer)上进行了大量实验。结果证明了ASD在稳定3D生成器训练、高质量3D内容合成以及其卓越的提示一致性方面的有效性,尤其是在大型提示语料库下。
引用
@article{arxiv.2407.02040,
title = {ScaleDreamer: Scalable Text-to-3D Synthesis with Asynchronous Score Distillation},
author = {Zhiyuan Ma and Yuxiang Wei and Yabin Zhang and Xiangyu Zhu and Zhen Lei and Lei Zhang},
journal= {arXiv preprint arXiv:2407.02040},
year = {2024}
}
备注
Accepted by ECCV 2024. Code available at https://github.com/theEricMa/ScaleDreamer