中文

基于Patchification的文本驱动3D体积完成——VP-LLM

计算机视觉与模式识别 2024-06-11 v1 人工智能

摘要

近期的条件3D完成方法主要依赖CLIP或BERT对文本信息进行编码,无法支持复杂指令。与此同时,大语言模型(LLM)在多模态理解与生成任务中展现出巨大的潜力。灵感来源于LLM的最新进展,我们提出了体积补丁语言模型(Volume Patch LLM, VP-LLM),通过LLM实现单次前向传播的条件3D完成。为将3D模型集成到LLM的标记化配置中,将不完整的3D物体首先划分为可独立编码的小块。这些编码后的补丁随文本提示输入LLM,以指示其捕捉这些补丁之间的关系,并将语义意义注入3D物体。我们的实验结果表明,LLM在解释复杂文本指令和理解3D物体方面具有强大的能力,显著优于基于扩散的3D完成模型在生成质量方面的表现。

关键词

引用

@article{arxiv.2406.05543,
  title  = {VP-LLM: Text-Driven 3D Volume Completion with Large Language Models through Patchification},
  author = {Jianmeng Liu and Yichen Liu and Yuyao Zhang and Zeyuan Meng and Yu-Wing Tai and Chi-Keung Tang},
  journal= {arXiv preprint arXiv:2406.05543},
  year   = {2024}
}

备注

27pages, 16 figures