通过线性化前瞻变分得分蒸馏提升文本到3D生成
计算机视觉与模式识别
2025-07-15 v1
摘要
基于对预训练2D扩散模型进行得分蒸馏的文本到3D生成正在引起日益关注,变分得分蒸馏(VSD)作为典型例子。VSD证明,引入额外得分模型(该模型刻画从3D模型渲染图像的分布)以纠正蒸馏梯度可改进纯粹得分蒸馏。尽管存在理论基础,但VSD在实际中可能 suffer于慢速且有时不恰当的收敛。在本文中,我们深入调查了引入的得分模型与3D模型之间的相互作用,发现实际实现中存在LoRA与3D分布之间的不匹配问题。我们仅通过调整优化顺序即可提升生成质量。如此一来,得分模型即可对当前3D状态进行前瞻,从而提供更合理的校正。然而,naive前瞻VSD在实际中可能因潜在过拟合而导致训练不稳定。为此,我们提出使用模型的线性化变种进行得分蒸馏,形成Linearized Lookahead Variational Score Distillation(-VSD)。-VSD可通过现有深度学习库的前向模式自动微分功能高效实现。广泛实验验证了-VSD的有效性,揭示其在先前基于得分蒸馏的方法中显著优势。我们还展示了本方法可无缝集成到任何其他VSD-based文本到3D框架中。
引用
@article{arxiv.2507.09748,
title = {Advancing Text-to-3D Generation with Linearized Lookahead Variational Score Distillation},
author = {Yu Lei and Bingde Liu and Qingsong Xie and Haonan Lu and Zhijie Deng},
journal= {arXiv preprint arXiv:2507.09748},
year = {2025}
}
备注
Accepted by ICCV 2025