3D-LLaVA: 面向通用3D大语言模型的Omni Superpoint Transformer
计算机视觉与模式识别
2025-04-25 v2
摘要
当前3D大型多模态模型(3D LMM)在3D视觉对话和推理方面显示出巨大的潜力。然而,如何进一步提升3D LMM以实现细粒度场景理解并促进灵活的人机交互仍是一个具有挑战性的问题。本文引入3D-LLaVA,一个简单却功能强大的3D LMM,旨在作为理解、推理和与3D世界交互的智能助手。不同于依赖复杂管道(如离线多视角特征提取或额外任务特定头部)的现有顶尖方法,3D-LLaVA采用极简设计,仅接受点云输入。3D-LLaVA的核心是全新Omni Superpoint Transformer(OST),其集成了三种功能:(1)视觉特征选择器,用于转换和选择视觉token;(2)视觉提示编码器,将交互式视觉提示嵌入视觉token空间;(3)指涉掩码解码器,基于文本描述生成3D掩码。这种多功能的OST通过混合预训练获得感知先验,并作为视觉连接器将3D数据桥接到LLM。经过统一指令调谐后,3D-LLaVA在各种基准测试中取得令人瞩目的成绩。
引用
@article{arxiv.2501.01163,
title = {3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer},
author = {Jiajun Deng and Tianyu He and Li Jiang and Tianyu Wang and Feras Dayoub and Ian Reid},
journal= {arXiv preprint arXiv:2501.01163},
year = {2025}
}
备注
Accepted by CVPR 2025