X-Dreamer:通过弥合文本到二维与文本到三维生成间的领域鸿沟来创建高质量三维内容
计算机视觉与模式识别
2024-07-31 v3
摘要
近来,在预训练二维扩散模型发展的推动下,自动文本到三维内容创建取得了显著进展。现有文本到三维方法通常优化三维表示,以确保渲染图像与给定文本良好对齐,该对齐由预训练二维扩散模型评估。然而,二维图像与三维资产之间存在显著的领域鸿沟,主要归因于相机相关属性的差异以及仅存在前景物体。因此,直接采用二维扩散模型优化三维表示可能导致次优结果。为解决此问题,我们提出 X-Dreamer,一种用于高质量文本到三维内容创建的新型方法,有效弥合了文本到二维与文本到三维合成之间的鸿沟。X-Dreamer 的关键组成部分为两项创新设计:相机引导低秩自适应(CG-LoRA)与注意力掩码对齐(AMA)损失。CG-LoRA 通过采用相机相关的可训练参数生成,将相机信息动态融入预训练扩散模型。该融合增强了生成的三维资产与相机视角之间的对齐。AMA 损失利用三维物体的二值掩码引导预训练扩散模型的注意力图,优先创建前景物体。该模块确保模型聚焦于生成准确且细致的前景物体。大量评估证明了我们所提方法相较现有文本到三维方法的有效性。项目主页:https://xmu-xiaoma666.github.io/Projects/X-Dreamer/ 。
引用
@article{arxiv.2312.00085,
title = {X-Dreamer: Creating High-quality 3D Content by Bridging the Domain Gap Between Text-to-2D and Text-to-3D Generation},
author = {Yiwei Ma and Yijun Fan and Jiayi Ji and Haowei Wang and Xiaoshuai Sun and Guannan Jiang and Annan Shu and Rongrong Ji},
journal= {arXiv preprint arXiv:2312.00085},
year = {2024}
}
备注
ToMM24