中文

Point-MoE:面向3D语义分割的大规模多数据集混合专家训练

计算机视觉与模式识别 2026-03-03 v2

摘要

尽管大规模扩展数据和模型已在自然语言处理和2D视觉领域成为核心,但其对3D点云理解的益处仍然有限。我们在一种现实设定下研究扩展3D点云理解的初始步骤:进行3D语义分割的大规模多数据集联合训练,且在训练或推理时不使用数据集标签。点云来源于多种传感器(如深度相机、LiDAR)和场景(如室内、室外),产生异构的扫描模式、采样密度和语义偏差;简单混合此类数据集会降低标准模型的性能。因此,我们引入了 Point-MoE,这是一种混合专家设计,通过稀疏激活的专家 MLP 和轻量级 top-kk 路由器扩展模型容量,允许 token 选择专门的专家而无需数据集监督。Point-MoE 在多样化的室内外数据集上联合训练,并在已见数据集及零样本设置下进行评估,其在训练或推理中均不使用数据集标签,性能依然超越了现有方法。这为3D感知勾勒了一条可扩展的路径:让模型在异构3D数据中发现结构,而非通过人工整理或特定数据集的启发式方法来强加结构。

关键词

引用

@article{arxiv.2505.23926,
  title  = {Point-MoE: Large-Scale Multi-Dataset Training with Mixture-of-Experts for 3D Semantic Segmentation},
  author = {Xuweiyi Chen and Wentao Zhou and Aruni RoyChowdhury and Zezhou Cheng},
  journal= {arXiv preprint arXiv:2505.23926},
  year   = {2026}
}

备注

Project page: https://point-moe.cs.virginia.edu/