中文

利用训练-free 技术在文本到 2D 生成中提升方法,应用于文本到 3D 生成的 Score Distillation Sampling

计算机视觉与模式识别 2025-05-28 v1

摘要

最近的研究表明,简单的训练-free 技术可显著提升文本到 2D 生成输出的质量,例如 Classifier-Free Guidance(CFG)或 FreeU。然而,这些训练-free 技术在 Score Distillation Sampling(SDS)这一流行且有效的技术视角下仍鲜有被探索——后者是利用预训练文本到 2D 扩散模型实现多种任务的常用方法。本文旨在阐明此类训练-free 技术对 SDS 的影响,具体通过文本到 3D 生成的 2D 升维应用进行考察。我们呈现的发现表明,varying CFG 的比例在物体大小与表面光滑性之间呈现权衡,而 varying FreeU 的比例在纹理细节与几何误差之间呈现权衡。基于这些发现,我们提供了如何有效地通过在动态方式下针对时间步或优化迭代步骤对此类技术进行比例调节来充分利用训练-free 技术的洞见。我们表明,使用我们提出的方案可在文本到 3D 生成中实现纹理细节与表面光滑性之间的有利平衡,同时保持输出尺寸并减轻几何缺陷的发生。

关键词

引用

@article{arxiv.2505.19868,
  title  = {Harnessing the Power of Training-Free Techniques in Text-to-2D Generation for Text-to-3D Generation via Score Distillation Sampling},
  author = {Junhong Lee and Seungwook Kim and Minsu Cho},
  journal= {arXiv preprint arXiv:2505.19868},
  year   = {2025}
}