中文

3DMIT:用于场景理解的 3D 多模态指令微调

计算机视觉与模式识别 2024-01-17 v2 多媒体

摘要

多模态大语言模型(MLLMs)在理解视觉和语言信息方面的巨大潜力已得到广泛认可。然而,与 2D 对应物相比,3D 场景 - 语言对的稀缺,加上现有方法在 LLMs 理解 3D 场景方面的不足,构成了重大挑战。为此,我们收集并构建了一个包含 75K 个专为 3D 场景定制的指令 - 响应对的大型数据集。该数据集涵盖了 3D VQA、3D 定位和 3D 对话等任务。为了进一步增强 3D 空间信息与 LLMs 的整合,我们引入了一种新颖高效的提示微调范式 3DMIT。该范式消除了 3D 场景与语言之间的对齐阶段,并利用包括整个场景和分割对象在内的 3D 模态信息扩展了指令提示。我们在 3D 场景领域的多样化任务中评估了我们方法的有效性,发现我们的方法是丰富 LLMs 对 3D 世界理解的战略手段。我们的代码可在 https://github.com/staymylove/3DMIT 获取。

关键词

引用

@article{arxiv.2401.03201,
  title  = {3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding},
  author = {Zeju Li and Chao Zhang and Xiaoyan Wang and Ruilong Ren and Yifan Xu and Ruifei Ma and Xiangde Liu},
  journal= {arXiv preprint arXiv:2401.03201},
  year   = {2024}
}

备注

9 pages, 5 figures