中文

CitySeg:面向城市规模场景的 3D 开放词汇语义分割基础模型

计算机视觉与模式识别 2025-08-14 v1

摘要

城市规模点云的语义分割是无人机感知系统的关键技术,能够在不依赖视觉信息的情况下对 3D 点进行分类,以实现完整的 3D 理解。然而,现有模型常受限于数据规模有限以及数据集之间存在的领域差距,导致泛化能力下降。为此,我们提出了 CitySeg,这是一个面向城市规模点云语义分割的基础模型,融合文本模态以实现开放词汇分割和零样推理。具体而言,为缓解跨多个领域数据分布不均的问题,我们定制了数据预处理规则,并提出了一种局部-全局交叉注意力网络,以增强无人机场景中点云网络的感知能力。为解决跨数据集的语义标签不一致问题,我们引入了分层分类策略。依据数据标注规则建立的分层图构成了数据标签,图编码器用于建模类别之间的分层关系。此外,我们提出了两阶段训练策略,并采用 hinge loss 来增加子类的特征可分性。实验结果表明,所提出的 CitySeg 在九个封闭集基准上实现了状态最佳 (SOTA) 性能,显著优于现有方法。更重要的是,CitySeg 首次实现了在不依赖视觉信息的情况下的城市规模点云场景的零样推理。

关键词

引用

@article{arxiv.2508.09470,
  title  = {CitySeg: A 3D Open Vocabulary Semantic Segmentation Foundation Model in City-scale Scenarios},
  author = {Jialei Xu and Zizhuang Wei and Weikang You and Linyun Li and Weijian Sun},
  journal= {arXiv preprint arXiv:2508.09470},
  year   = {2025}
}