面向 3D 大语言模型的统一场景表示与重建
计算机视觉与模式识别
2024-04-22 v1
摘要
使大语言模型(LLMs)与 3D 环境交互是一项具有挑战性的任务。现有方法要么从真实值(GT)几何中提取点云,要么从辅助模型重建的 3D 场景中提取点云。然后将来自 CLIP 的文本-图像对齐的 2D 特征提升到点云,作为 LLMs 的输入。然而,这种解决方案缺乏 3D 点到点连接的建立,导致空间结构信息的缺失。同时,场景的几何表示和语义表示之间缺乏整合与统一,最终导致 3D 场景理解水平的下降。在本文中,我们证明了拥有统一场景表示和重建框架的重要性,这对于 LLMs 在 3D 场景中的应用至关重要。具体而言,我们引入了 Uni3DR^2,它通过冻结的预训练 2D 基础模型(如 CLIP 和 SAM)以及多尺度聚合 3D 解码器,提取 3D 几何和语义感知表示特征。我们学习到的 3D 表示不仅有助于重建过程,还为 LLMs 提供了宝贵的知识。实验结果验证了我们的 Uni3DR^2 在 3D 重建数据集 ScanNet 上相较于基线取得了令人信服的收益(F-Score 提升 +1.8%)。当应用于 LLMs 时,我们的 Uni3DR^2-LLM 在 3D 视觉-语言理解数据集 ScanQA 上表现出优于基线的性能(在验证集和测试集上 BLEU-1 分别提升 +4.0% 和 +4.2%)。此外,它在 ScanQA 和 3DMV-VQA 上均优于使用额外 GT 点云的最先进方法。
引用
@article{arxiv.2404.13044,
title = {Unified Scene Representation and Reconstruction for 3D Large Language Models},
author = {Tao Chu and Pan Zhang and Xiaoyi Dong and Yuhang Zang and Qiong Liu and Jiaqi Wang},
journal= {arXiv preprint arXiv:2404.13044},
year = {2024}
}
备注
Project Page: https://chtsy.github.io/uni3drr-page/