中文

Inst3D-LMM:基于多模态指令微调的实例感知 3D 场景理解

计算机视觉与模式识别 2025-06-17 v2

摘要

尽管 3D 场景理解取得了令人鼓舞的进展,但开发能够理解和推理复杂 3D 环境的有效大多模态模型(LMM)仍然具有挑战性。大多数先前的方法通常分别编码 3D 点云和 2D 图像特征,忽略了 2D 语义与 3D 物体属性之间的交互,以及 3D 环境内的空间关系。这一局限不仅阻碍了对 3D 场景的全面表征,还影响了训练和推理效率。为应对这些挑战,我们提出了一种统一的实例感知 3D 大多模态模型(Inst3D-LMM),用于同时处理多种 3D 场景理解任务。为了获取细粒度的实例级视觉 token,我们首先引入了一种新颖的多视角跨模态融合(MCMF)模块,将多视角 2D 语义注入其对应的 3D 几何特征。为了获取场景级关系感知 token,我们进一步提出了 3D 实例空间关系(3D-ISR)模块,用于捕捉物体之间复杂的成对空间关系。此外,我们在没有后续任务特定微调的情况下进行了端到端多任务指令微调。大量实验表明,我们的方法在 3D 场景理解、推理和定位任务上超越了现有最先进方法。源代码可在 https://github.com/hanxunyu/Inst3D-LMM 获取。

关键词

引用

@article{arxiv.2503.00513,
  title  = {Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction Tuning},
  author = {Hanxun Yu and Wentong Li and Song Wang and Junbo Chen and Jianke Zhu},
  journal= {arXiv preprint arXiv:2503.00513},
  year   = {2025}
}

备注

CVPR2025, Code Link: https://github.com/hanxunyu/Inst3D-LMM