LucidDreaming:可控的以对象为中心的3D生成
计算机视觉与模式识别
2024-08-12 v2 图形学
摘要
随着生成模型的最近发展,文本到3D生成也取得了显著增长,为更广泛的公众通过文本创建视频游戏3D资产打开了大门。然而,没有任何专业3D编辑经验的用户会发现很难实现对3D生成的精确控制,尤其是在提示中包含多个对象时,因为使用文本进行控制常常导致对象缺失和位置不精确。在本文中,我们提出LucidDreaming作为一种有效的流水线,能够仅从文本提示命令或3D边界框对3D生成进行空间和数量控制。具体而言,我们的研究表明大语言模型(LLMs)具备3D空间感知能力,并能够有效地将文本3D信息转换为精确的3D边界框。我们利用LLMs获取单个对象信息及其3D边界框作为我们流程的初始步骤。然后借助边界框,我们进一步提出裁剪射线采样(clipped ray sampling)和以对象为中心的密度块偏置(object-centric density blob bias)来生成与边界框对齐的3D对象。我们展示了我们的方法在一系列主流的基于分数蒸馏采样(Score Distillation Sampling)的3D生成框架中具有显著的适应性,并且我们的流水线甚至可用于将对象插入到现有的NeRF场景中。此外,我们还提供了一个带有3D边界框的提示数据集,用于基准测试3D空间可控性。通过广泛的定性和定量实验,我们证明LucidDreaming在对象放置精度和生成保真度方面相比当前方法取得了更优的结果,同时为非专业用户保持了灵活性和易用性。
引用
@article{arxiv.2312.00588,
title = {LucidDreaming: Controllable Object-Centric 3D Generation},
author = {Zhaoning Wang and Ming Li and Chen Chen},
journal= {arXiv preprint arXiv:2312.00588},
year = {2024}
}