3UR-LLM:用于三维场景理解的端到端多模态大语言模型
计算机视觉与模式识别
2025-01-15 v1
摘要
多模态大语言模型(MLLMs)在2D任务中展现出令人瞩目的能力,但在从2D向3D表征转换时,在辨别场景中的空间位置、相互关系和因果逻辑方面遇到了挑战。我们发现这些局限性主要在于:i) 高昂的标注成本限制了3D场景数据规模的扩大;ii) 缺乏直接有效感知3D信息的方法,导致训练时间延长并使精简框架复杂化。为此,我们开发了一个基于开源2D MLLMs和LLMs的流水线,以生成高质量的3D-文本对并构建3DS-160K,以增强预训练过程。利用这一高质量的预训练数据,我们引入了3UR-LLM模型,这是一个端到端的3D MLLM,旨在精确解读3D场景,在应对物理世界的复杂性方面展现出卓越能力。3UR-LLM直接接收3D点云作为输入,并将融合了文本指令的3D特征投影为一组可管理的token。考虑到这些混合token带来的计算负担,我们设计了一个3D压缩器模块,以紧凑地压缩3D空间线索和文本叙述。3UR-LLM相较于先前的SOTAs取得了有前景的性能,例如,在ScanQA上,3UR-LLM以更少的训练资源超越了同类模型7.1%的CIDEr。3UR-LLM的代码和模型权重以及3DS-160K基准测试可在3UR-LLM获取。
引用
@article{arxiv.2501.07819,
title = {3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding},
author = {Haomiao Xiong and Yunzhi Zhuge and Jiawen Zhu and Lu Zhang and Huchuan Lu},
journal= {arXiv preprint arXiv:2501.07819},
year = {2025}
}
备注
Accepted to IEEE Transactions on Multimedia (TMM)