Lemon:用于通用空间理解的统一可扩展 3D 多模态模型
计算机视觉与模式识别
2025-12-16 v1 人工智能
摘要
将大型多模态模型(LMM)扩展到 3D 理解带来了独特的挑战:点云数据稀疏且不规则,现有模型依赖于具有特定模态编码器的碎片化架构,且训练流程通常存在不稳定性和较差的可扩展性。我们引入了 Lemon,一种统一的 Transformer 架构,通过将 3D 点云分块和语言 token 作为单一序列联合处理来解决这些挑战。与依赖特定模态编码器和跨模态对齐模块的先前工作不同,这种设计实现了早期的空间-语言融合,消除了冗余编码器,提高了参数效率,并支持更有效的模型缩放。为了处理 3D 数据的复杂性,我们开发了一种保留空间上下文的结构化分块与 token 化方案,以及一个从物体级识别到场景级空间推理逐步构建能力的三阶段训练课程。Lemon 在从物体识别、字幕生成到 3D 场景空间推理的综合性 3D 理解与推理任务中确立了新的 SOTA 性能,同时随着模型规模和训练数据的增加展现出稳健的缩放特性。我们的工作为推进真实世界应用中的 3D 空间智能提供了统一的基础。
引用
@article{arxiv.2512.12822,
title = {Lemon: A Unified and Scalable 3D Multimodal Model for Universal Spatial Understanding},
author = {Yongyuan Liang and Xiyao Wang and Yuanchen Ju and Jianwei Yang and Furong Huang},
journal= {arXiv preprint arXiv:2512.12822},
year = {2025}
}