中文

OpenUrban3D:大规模城市点云的无标注开放词汇语义分割

计算机视觉与模式识别 2025-09-16 v1

摘要

开放词汇语义分割使模型能够识别并分割来自任意自然语言描述的对象, offering 灵活性以处理 novel、fine-grained 或功能定义的类别,超越固定标签集。虽然这一能力对于支持数字孪生、智慧城市管理和城市分析等大规模城市点云数据集至关重要,但在该领域仍 largely 未被探索。主要障碍是大规模城市点云数据集中经常缺乏高质量、正确对齐的多视图图像,以及现有 3D 分割管道在具有显著几何、尺度和外观变化的 diverse urban environments 之间的poor generalization。为解决这些挑战,我们提出 OpenUrban3D,第一个为大规模城市场景开发的 3D 开放词汇语义分割框架,无需对齐的多视图图像、预训练的点云分割网络或手动标注。我们的方法通过多视角、多粒度渲染从原始点云中生成 robust semantic features,随后通过 mask-level vision-language feature extraction 和 sample-balanced fusion,将其蒸馏到 3D backbone 模型。这种设计使 zero-shot segmentation for arbitrary text queries 成为可能,同时捕获语义丰富性和几何先验。广泛的实验在大规模城市基准数据集上进行,包括 SensatUrban 和 SUM,结果表明 OpenUrban3D 在语义分割准确率和跨场景泛化方面均显著优于现有方法,展示了其作为灵活且可扩展的 3D 城市场景理解解决方案的潜力。

关键词

引用

@article{arxiv.2509.10842,
  title  = {OpenUrban3D: Annotation-Free Open-Vocabulary Semantic Segmentation of Large-Scale Urban Point Clouds},
  author = {Chongyu Wang and Kunlei Jing and Jihua Zhu and Di Wang},
  journal= {arXiv preprint arXiv:2509.10842},
  year   = {2025}
}