HiFA:基于先进扩散引导的高保真文本到三维生成
计算机视觉与模式识别
2024-03-12 v4 人工智能
机器学习
摘要
自动文本到三维生成的进展引人注目。大多数现有方法使用预训练的文本到图像扩散模型,通过潜空间去噪分数匹配来优化神经辐射场(NeRF)等三维表示。然而,由于次优的优化方法和对三维几何有限的理解,这些方法常导致伪影和跨视角不一致。此外,NeRF 在渲染清晰几何与稳定纹理上的固有局限通常需要两阶段优化以获得高分辨率细节。本工作提出整体采样与平滑方法,在单阶段优化中实现高质量文本到三维生成。我们在文本到图像扩散模型的潜空间与图像空间中计算去噪分数。我们未随机采样时间步(在去噪分数匹配中亦称噪声水平),而是引入一种新颖的时间步退火方法,在优化过程中逐步降低所采样的时间步。为在单阶段优化中生成高质量渲染,我们提出对沿 NeRF 光线的 z 坐标方差进行正则化。为解决 NeRF 中的纹理闪烁问题,我们引入一种核平滑技术,由粗到精地细化重要性采样权重,确保在高密度区域准确而充分的采样。大量实验证明了我们的方法优于先前方法,能够通过单阶段训练过程生成高度细致且视角一致的三维资产。
引用
@article{arxiv.2305.18766,
title = {HiFA: High-fidelity Text-to-3D Generation with Advanced Diffusion Guidance},
author = {Junzhe Zhu and Peiye Zhuang and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2305.18766},
year = {2024}
}
备注
Project page: https://hifa-team.github.io/HiFA-site/