3DMIT:用于场景理解的 3D 多模态指令微调
计算机视觉与模式识别
2024-01-17 v2 多媒体
摘要
多模态大语言模型(MLLMs)在理解视觉和语言信息方面的巨大潜力已得到广泛认可。然而,与 2D 对应物相比,3D 场景 - 语言对的稀缺,加上现有方法在 LLMs 理解 3D 场景方面的不足,构成了重大挑战。为此,我们收集并构建了一个包含 75K 个专为 3D 场景定制的指令 - 响应对的大型数据集。该数据集涵盖了 3D VQA、3D 定位和 3D 对话等任务。为了进一步增强 3D 空间信息与 LLMs 的整合,我们引入了一种新颖高效的提示微调范式 3DMIT。该范式消除了 3D 场景与语言之间的对齐阶段,并利用包括整个场景和分割对象在内的 3D 模态信息扩展了指令提示。我们在 3D 场景领域的多样化任务中评估了我们方法的有效性,发现我们的方法是丰富 LLMs 对 3D 世界理解的战略手段。我们的代码可在 https://github.com/staymylove/3DMIT 获取。
引用
@article{arxiv.2401.03201,
title = {3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding},
author = {Zeju Li and Chao Zhang and Xiaoyan Wang and Ruilong Ren and Yifan Xu and Ruifei Ma and Xiangde Liu},
journal= {arXiv preprint arXiv:2401.03201},
year = {2024}
}
备注
9 pages, 5 figures