Proc3D:利用大语言模型进行三维形状的程序化生成与参数化编辑
图形学
2026-01-21 v1 人工智能
计算机视觉与模式识别
摘要
生成三维模型传统上是一项需要专业知识的复杂任务。尽管生成式人工智能的最新进展试图自动化这一过程,但现有方法产生的是不可编辑的表示形式,如网格或点云,限制了其在迭代设计中的适应性。在本文中,我们介绍了 Proc3D,一个旨在生成可编辑三维模型并支持实时修改的系统。其核心是 Proc3D 引入了程序化紧凑图(PCG),这是一种三维模型的图表示,编码了生成模型所需的算法规则和结构。这种表示暴露了关键参数,允许通过滑块和复选框进行直观的手动调整,以及通过大语言模型(LLM)使用自然语言提示进行实时、自动的修改。我们使用两种生成方法展示了 Proc3D 的能力:带有上下文学习(ICL)的 GPT-4o 和微调的 LLAMA-3 模型。实验结果表明,Proc3D 在编辑效率上优于现有方法,相比每次修改都需要完全重新生成的传统方法,速度提升了 400 倍以上。此外,Proc3D 将 ULIP 分数提高了 28%,该指标用于评估生成的三维模型与文本提示之间的对齐程度。通过实现文本对齐的三维模型生成以及精确、实时的参数化编辑,Proc3D 促进了高精度的基于文本的图像编辑应用。
引用
@article{arxiv.2601.12234,
title = {Proc3D: Procedural 3D Generation and Parametric Editing of 3D Shapes with Large Language Models},
author = {Fadlullah Raji and Stefano Petrangeli and Matheus Gadelha and Yu Shen and Uttaran Bhattacharya and Gang Wu},
journal= {arXiv preprint arXiv:2601.12234},
year = {2026}
}