中文

Magic3DSketch:基于文本与语言-图像预训练引导的彩色 3D 模型快速生成方法

计算机视觉与模式识别 2024-07-30 v1 多媒体

摘要

随着 AR/VR 应用的不断涌现,3D 内容的需求日益增长。然而,传统的计算机辅助设计(CAD)等方法往往计算耗时且对技术要求高,导致 3D 建模仅限于少数专业用户,初学者难以使用。我们提出的 Magic3DSketch 方法采用新型技术,对草图进行编码以预测 3D 网格,并通过文本描述和语言-图像预训练获取的外部先验知识进行引导。语言-图像预训练神经网络的集成弥补了单视图草图输入稀疏且模糊的局限。我们的方法相较于现有的文本到 3D 方法在实用性和可控性方面更具优势,根据我们的用户研究结果。此外,Magic3DSketch 在合成数据集和真实数据集上均实现了最前沿性能,能够在文本输入的帮助下生成更细致的结构和更真实的形状。用户研究还显示,使用 Magic3DSketch 生成的模型更受欢迎。我们也是首次(据我们所知)在草图衍生形状上基于文本描述添加颜色。通过将草图和文本引导与语言-图像预训练模型结合,Magic3DSketch 允许新手用户以最小的 effort 实现最大的创造自由度来创建自定义 3D 模型, potentially revolutionizing future 3D modeling pipelines.

关键词

引用

@article{arxiv.2407.19225,
  title  = {Magic3DSketch: Create Colorful 3D Models From Sketch-Based 3D Modeling Guided by Text and Language-Image Pre-Training},
  author = {Ying Zang and Yidong Han and Chaotao Ding and Jianqi Zhang and Tianrun Chen},
  journal= {arXiv preprint arXiv:2407.19225},
  year   = {2024}
}