3DRS:多模态大语言模型需要三维感知表示监督以实现场景理解
计算机视觉与模式识别
2025-12-09 v2
摘要
场景理解的最新进展利用多模态大语言模型(MLLMs)凭借其强大的二维预训练进行三维推理。然而,MLLM预训练期间缺乏显式的三维数据限制了其三维表示能力。本文通过评估多视图对应关系来研究MLLM的三维感知能力,并揭示了三维感知表示的质量与下游任务性能之间存在强正相关。受此启发,我们提出了3DRS,一个通过引入预训练三维基础模型的监督来增强MLLM三维表示学习的框架。我们的方法将MLLM视觉特征与从三维模型中蒸馏出的丰富三维知识相对齐,有效提升了场景理解能力。在多个基准测试和MLLM上开展的大量实验——包括视觉定位、图像描述和问答——证明了其一致的性能提升。项目页面:https://visual-ai.github.io/3drs
引用
@article{arxiv.2506.01946,
title = {3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding},
author = {Xiaohu Huang and Jingjing Wu and Qunyi Xie and Kai Han},
journal= {arXiv preprint arXiv:2506.01946},
year = {2025}
}