中文

Uni3D-MoE:基于混合专家机制的可扩展多模态 3D 场景理解

计算机视觉与模式识别 2025-05-28 v1

摘要

多模态大语言模型(MLLM)的最新进展展示了其在全面 3D 场景理解方面的巨大潜力。然而,现有方法通常仅利用一种或有限的 3D 模态子集,导致 3D 场景的表示不完整并降低了理解准确率。此外,不同类型的查询本质上依赖于不同的模态,这表明对所有模态 token 的统一处理可能无法有效捕获特定于查询的上下文。为了应对这些挑战,我们提出了 Uni3D-MoE,一种基于稀疏混合专家机制的 3D MLLM,旨在实现自适应的 3D 多模态融合。具体而言,Uni3D-MoE 集成了全面的 3D 模态集合,包括多视角 RGB 和深度图像、鸟瞰图(BEV)地图、点云和体素表示。其核心是,我们的框架在基于稀疏 MoE 的大语言模型中采用了一种可学习的路由机制,在 token 级别动态选择合适的专家。每个专家基于学习到的模态偏好专门处理多模态 token,从而促进针对不同任务特定需求量身定制的灵活协作。在标准 3D 场景理解基准和专门数据集上的广泛评估证明了 Uni3D-MoE 的有效性。

关键词

引用

@article{arxiv.2505.21079,
  title  = {Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts},
  author = {Yue Zhang and Yingzhao Jian and Hehe Fan and Yi Yang and Roger Zimmermann},
  journal= {arXiv preprint arXiv:2505.21079},
  year   = {2025}
}