中文

3DRS:多模态大语言模型需要三维感知表示监督以实现场景理解

计算机视觉与模式识别 2025-12-09 v2

摘要

场景理解的最新进展利用多模态大语言模型(MLLMs)凭借其强大的二维预训练进行三维推理。然而,MLLM预训练期间缺乏显式的三维数据限制了其三维表示能力。本文通过评估多视图对应关系来研究MLLM的三维感知能力,并揭示了三维感知表示的质量与下游任务性能之间存在强正相关。受此启发,我们提出了3DRS,一个通过引入预训练三维基础模型的监督来增强MLLM三维表示学习的框架。我们的方法将MLLM视觉特征与从三维模型中蒸馏出的丰富三维知识相对齐,有效提升了场景理解能力。在多个基准测试和MLLM上开展的大量实验——包括视觉定位、图像描述和问答——证明了其一致的性能提升。项目页面:https://visual-ai.github.io/3drs

关键词

引用

@article{arxiv.2506.01946,
  title  = {3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding},
  author = {Xiaohu Huang and Jingjing Wu and Qunyi Xie and Kai Han},
  journal= {arXiv preprint arXiv:2506.01946},
  year   = {2025}
}