开放世界点云语义分割:人机协同框架
计算机视觉与模式识别
2025-08-08 v1 图形学
摘要
开放世界点云语义分割(OW-Seg)旨在预测真实场景中基类和新类的点标签。然而,现有方法依赖资源密集的离线增量学习或密集标注的支持数据,限制了其实用性。为了解决这些局限性,我们提出了 HOW-Seg,这是首个用于 OW-Seg 的人机协同框架。具体而言,我们直接在查询数据上构建类原型(即基本分割单元),避免了支持数据和查询数据之间类内分布偏移引起的原型偏差。通过利用稀疏人工标注作为指导,HOW-Seg 能够对基类和新类进行基于原型的分割。考虑到初始原型的粒度不足,我们引入了分层原型消歧机制来细化对应于不同类标注的模糊原型。为了进一步丰富上下文感知,我们在细化后的原型上应用密集条件随机场(CRF)以优化其标签分配。通过迭代的人工反馈,HOW-Seg 动态改进其预测,实现对基类和新类的高质量分割。实验表明,在稀疏标注(例如,一个新类一次点击)下,HOW-Seg 在 5-shot 设置下匹配或超越了最先进的广义少样本分割(GFS-Seg)方法。当使用先进的骨干网络(例如 Stratified Transformer)和更密集的标注(例如每个子场景 10 次点击)时,HOW-Seg 在 S3DIS 上实现了 85.27% 的 mIoU,在 ScanNetv2 上实现了 66.37% 的 mIoU,显著优于其他方法。
引用
@article{arxiv.2508.04962,
title = {Open-world Point Cloud Semantic Segmentation: A Human-in-the-loop Framework},
author = {Peng Zhang and Songru Yang and Jinsheng Sun and Weiqing Li and Zhiyong Su},
journal= {arXiv preprint arXiv:2508.04962},
year = {2025}
}
备注
To be published in IEEE Transactions on Circuits and Systems for Video Technology