中文

LLaVA-3D: 赋予大型多模态模型3D感知能力的简单有效途径

计算机视觉与模式识别 2025-04-29 v3

摘要

大型多模态模型(LMMs)的最新进展极大地增强了它们在2D视觉理解任务中的能力,使其能够有效处理和理解图像与视频。然而,具有3D场景理解能力的LMMs的发展一直受到缺乏大规模3D视觉-语言数据集和强大3D编码器的阻碍。本文中,我们介绍了一个名为LLaVA-3D的简单而有效的框架。利用LLaVA强大的2D视觉理解先验,我们的LLaVA-3D高效地将LLaVA适配于3D场景理解,同时不损害2D理解能力。为此,我们利用3D位置嵌入来增强2D CLIP Patches的3D空间上下文信息,并构建3D Patches。通过将3D位置嵌入集成到2D LMMs中,并采用联合2D和3D视觉-语言指令调优,我们建立了一个统一的架构,用于2D视觉理解和3D场景理解。与之前的3D LMMs相比,LLaVA-3D支持直接从这些3D Patches解码准确的3D空间感知输出(例如3D边界框),而无需依赖耗时的现成3D分割器。实验结果表明,LLaVA-3D在3D视觉-语言数据集上训练时,收敛速度比现有3D LMMs快3.5倍。此外,LLaVA-3D不仅在各种3D任务上达到了最先进的性能,而且保持了与LLaVA相当的2D视觉理解和视觉-语言对话能力。

关键词

引用

@article{arxiv.2409.18125,
  title  = {LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness},
  author = {Chenming Zhu and Tai Wang and Wenwei Zhang and Jiangmiao Pang and Xihui Liu},
  journal= {arXiv preprint arXiv:2409.18125},
  year   = {2025}
}

备注

Project page: https://zcmax.github.io/projects/LLaVA-3D/