TexFusion:利用文本引导图像扩散模型合成 3D 纹理
计算机视觉与模式识别
2023-10-24 v1 机器学习
摘要
我们提出 TexFusion(Texture Diffusion),一种利用大规模文本引导图像扩散模型为给定 3D 几何合成纹理的新方法。与近期利用 2D 文本到图像扩散模型通过缓慢且脆弱的优化过程蒸馏 3D 物体的工作不同,TexFusion 引入了一种专为纹理合成设计的新的 3D 一致生成技术,该技术在不同 2D 渲染视图上采用常规扩散模型采样。具体而言,我们利用潜在扩散模型,在 3D 物体的一组 2D 渲染上应用扩散模型的去噪器,并在共享的潜在纹理图上聚合不同的去噪预测。最终输出的 RGB 纹理通过优化潜在纹理的 2D 渲染解码上的中间神经颜色场来生成。我们全面验证了 TexFusion,并表明我们可以高效生成多样、高质量且全局一致的纹理。我们仅使用图像扩散模型就实现了最先进的文本引导纹理合成性能,同时避免了先前基于蒸馏方法的缺陷。文本条件提供了细致控制,并且我们也不依赖任何真实 3D 纹理进行训练。这使得我们的方法具有通用性,可应用于广泛的几何与纹理类型。我们希望 TexFusion 能推动基于 AI 的 3D 资产纹理化在虚拟现实、游戏设计、仿真等领域的应用。
引用
@article{arxiv.2310.13772,
title = {TexFusion: Synthesizing 3D Textures with Text-Guided Image Diffusion Models},
author = {Tianshi Cao and Karsten Kreis and Sanja Fidler and Nicholas Sharp and Kangxue Yin},
journal= {arXiv preprint arXiv:2310.13772},
year = {2023}
}
备注
Videos and more results on https://research.nvidia.com/labs/toronto-ai/texfusion/