Aladdin:基于抽象场景描述的风格化 3D 资产零样本幻构
计算机视觉与模式识别
2023-06-13 v1 图形学
摘要
是什么构成了特定场景的“氛围”?在“一条繁忙、肮脏的城市街道”、“田园般的乡村”或“废弃客厅中的犯罪现场”中应该发现什么?从抽象场景描述到风格化场景元素的转换,无法由在僵化且有限的室内数据集上训练的现有系统以任何通用性完成。在本文中,我们提议利用基础模型所捕获的知识来完成这一转换。我们提出一个系统,可作为工具为短短语描述的 3D 场景生成风格化资产,而无需枚举场景中要发现的物体或给出其外观指令。此外,它对开放世界概念具有鲁棒性,这是传统在有限数据上训练的方法所不具备的,从而为 3D 艺术家提供更多创作自由。我们的系统通过使用由大语言模型、视觉-语言模型和若干图像扩散模型组成的基础模型“团队”来展示这一点,它们使用可解释且用户可编辑的中间表示进行通信,从而实现对 3D 艺术家更通用且可控的风格化资产生成。我们引入了该任务的新颖度量标准,并通过人工评估表明,在 91% 的情况下,我们的系统输出被判定比基线更忠实于输入场景描述的语义,从而凸显了该方法在大幅加速 3D 艺术家 3D 内容创作过程中的潜力。
引用
@article{arxiv.2306.06212,
title = {Aladdin: Zero-Shot Hallucination of Stylized 3D Assets from Abstract Scene Descriptions},
author = {Ian Huang and Vrishab Krishna and Omoruyi Atekha and Leonidas Guibas},
journal= {arXiv preprint arXiv:2306.06212},
year = {2023}
}