中文

方向感知的 3D 大多模态模型

计算机视觉与模式识别 2026-02-24 v1

摘要

3D 大多模态模型 (3D LMMs) 高度依赖 ego poses 以实现方向性问答和空间推理。然而,大多数现有点云基准包含丰富的方向性查询,却缺乏相应的 ego poses,导致其在 3D 大多模态建模中天然不成立。本文重新定义了一种新的严格范式,通过识别并补充 ego poses 到点云基准中,并根据识别的 ego poses 对相应点云数据进行变换,从而实现方向感知的 3D LMMs。我们通过两种新颖设计使 3D LMMs 具备方向感知能力。第一是 PoseRecover,一个完全自动的姿态恢复管道,通过对象-锥体相交和 Z-buffer 可见性检查将问题与 ego poses 从 RGB-D 视频外部匹配。第二是 PoseAlign 该方法将点云数据变换为与识别的 ego poses 对齐,而不是注入 ego poses 到文本提示中或在投影层中引入 pose 编码特征。广泛的实验表明,我们的设计在多个 3D LMM 主干网络(如 LL3DA, LL3DA-SONATA, Chat-Scene, 和 3D-LLAVA)上均一致地提高了性能,在 ScanRefer mIoU 提升了 30.0%,在 Scan2Cap LLM-as-judge 准确率提升了 11.7%。此外,我们的方法简单、通用且训练高效,只需指令调谐即可为方向感知 3D-LMMs 建立强大的基线。

关键词

引用

@article{arxiv.2602.19063,
  title  = {Direction-aware 3D Large Multimodal Models},
  author = {Quan Liu and Weihao Xuan and Junjue Wang and Naoto Yokoya and Ling Shao and Shijian Lu},
  journal= {arXiv preprint arXiv:2602.19063},
  year   = {2026}
}

备注

In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026