基于预训练多视图扩散模型的接地组合多样文本到3D生成
计算机视觉与模式识别
2024-04-30 v1 人工智能
摘要
本文提出一种名为Grounded-Dreamer的有效两阶段方法,利用预训练多视图扩散模型生成能够准确遵循复杂组合文本提示且具有高保真度的3D资产。多视图扩散模型(如MVDream)已证明可通过分数蒸馏采样(SDS)生成高保真3D资产。然而,直接应用这些方法往往无法理解组合文本提示,并可能完全忽略某些主体或部分。为解决此问题,我们首先倡导在文本到3D流程中将文本引导的四视图图像作为瓶颈。然后,我们引入一种注意力重聚焦机制,以鼓励生成与文本对齐的四视图图像,而无需重新训练多视图扩散模型或构建高质量组合3D数据集。我们进一步提出一种混合优化策略,以促进SDS损失与稀疏RGB参考图像之间的协同作用。我们的方法在生成组合3D资产方面持续优于先前最先进(SOTA)方法,在质量和准确性上均表现出色,并能从同一文本提示生成多样化的3D资产。
引用
@article{arxiv.2404.18065,
title = {Grounded Compositional and Diverse Text-to-3D with Pretrained Multi-View Diffusion Model},
author = {Xiaolong Li and Jiawei Mo and Ying Wang and Chethan Parameshwara and Xiaohan Fei and Ashwin Swaminathan and CJ Taylor and Zhuowen Tu and Paolo Favaro and Stefano Soatto},
journal= {arXiv preprint arXiv:2404.18065},
year = {2024}
}
备注
9 pages, 10 figures