中文

Uni3D-LLM:利用大语言模型统一点云感知、生成与编辑

计算机视觉与模式识别 2024-02-07 v1 人工智能 计算与语言

摘要

本文介绍了 Uni3D-LLM,一个利用大语言模型(LLM)来整合点云场景中三维感知、生成和编辑任务的统一框架。该框架使用户能够根据自然语言描述的通用性,轻松地在场景中指定位置生成和修改物体。Uni3D-LLM 利用自然语言的表达能力,实现对三维物体生成和编辑的精确指令,从而显著增强了操作的灵活性和可控性。通过将点云映射到统一的表示空间,Uni3D-LLM 实现了跨应用功能,能够无缝执行从三维物体的精确实例化到交互式设计的多样化需求等一系列广泛任务。通过一套全面的严格实验,Uni3D-LLM 在点云理解、生成和编辑方面的有效性得到了验证。此外,我们还评估了集成点云感知模块对生成和编辑过程的影响,证实了我们的方法在实际应用中的巨大潜力。

关键词

引用

@article{arxiv.2402.03327,
  title  = {Uni3D-LLM: Unifying Point Cloud Perception, Generation and Editing with Large Language Models},
  author = {Dingning Liu and Xiaoshui Huang and Yuenan Hou and Zhihui Wang and Zhenfei Yin and Yongshun Gong and Peng Gao and Wanli Ouyang},
  journal= {arXiv preprint arXiv:2402.03327},
  year   = {2024}
}

备注

10 pages, 6 figures