ShapeGPT:基于统一多模态语言模型的 3D 形状生成
计算机视觉与模式识别
2023-12-04 v3
摘要
大语言模型的出现通过指令驱动方法实现了灵活性,已革新许多传统生成任务,但面向 3D 数据的大模型,尤其在全面处理 3D 形状与其他模态方面,仍待深入探索。通过实现基于指令的形状生成,通用多模态生成形状模型可显著惠及 3D 虚拟构建与网络辅助设计等诸多领域。本工作中,我们提出 ShapeGPT,一种包含形状的多模态框架,利用强预训练语言模型处理多种形状相关任务。具体而言,ShapeGPT 采用词-句-段框架,将连续形状离散为形状词,进一步将这些词组合为形状句,并将形状与指令文本集成为多模态段落。为学习此形状-语言模型,我们采用三阶段训练方案,包括形状表示、多模态对齐与基于指令的生成,以对齐形状-语言码本并学习这些模态间的复杂关联。大量实验表明,ShapeGPT 在文本到形状、形状到文本、形状补全与形状编辑等形状相关任务上取得了可比性能。
引用
@article{arxiv.2311.17618,
title = {ShapeGPT: 3D Shape Generation with A Unified Multi-modal Language Model},
author = {Fukun Yin and Xin Chen and Chi Zhang and Biao Jiang and Zibo Zhao and Jiayuan Fan and Gang Yu and Taihao Li and Tao Chen},
journal= {arXiv preprint arXiv:2311.17618},
year = {2023}
}