Point-MoE:面向3D语义分割的大规模多数据集混合专家训练
计算机视觉与模式识别
2026-03-03 v2
摘要
尽管大规模扩展数据和模型已在自然语言处理和2D视觉领域成为核心,但其对3D点云理解的益处仍然有限。我们在一种现实设定下研究扩展3D点云理解的初始步骤:进行3D语义分割的大规模多数据集联合训练,且在训练或推理时不使用数据集标签。点云来源于多种传感器(如深度相机、LiDAR)和场景(如室内、室外),产生异构的扫描模式、采样密度和语义偏差;简单混合此类数据集会降低标准模型的性能。因此,我们引入了 Point-MoE,这是一种混合专家设计,通过稀疏激活的专家 MLP 和轻量级 top- 路由器扩展模型容量,允许 token 选择专门的专家而无需数据集监督。Point-MoE 在多样化的室内外数据集上联合训练,并在已见数据集及零样本设置下进行评估,其在训练或推理中均不使用数据集标签,性能依然超越了现有方法。这为3D感知勾勒了一条可扩展的路径:让模型在异构3D数据中发现结构,而非通过人工整理或特定数据集的启发式方法来强加结构。
引用
@article{arxiv.2505.23926,
title = {Point-MoE: Large-Scale Multi-Dataset Training with Mixture-of-Experts for 3D Semantic Segmentation},
author = {Xuweiyi Chen and Wentao Zhou and Aruni RoyChowdhury and Zezhou Cheng},
journal= {arXiv preprint arXiv:2505.23926},
year = {2026}
}
备注
Project page: https://point-moe.cs.virginia.edu/