中文

面向半监督双模态语义分割

计算机视觉与模式识别 2024-09-23 v1

摘要

随着3D和2D数据采集技术的发展,同时获取场景的点云和图像变得容易,这进一步促进了双模态语义分割。现有大多数同时对点云和图像进行分割的方法都严重依赖于标记训练数据的数量和质量。然而,大规模的点级和像素级标注过程往往耗时且代价高昂。为此,我们提出一种并行双流网络来处理半监督双模态语义分割任务,称为PD-Net,通过联合利用少量标记点云、大量未标记点云和未标记图像。所提出的PD-Net由两个并行流(称为原始流和伪标签预测流)组成。伪标签预测流预测未标记点云及其对应图像的伪标签。随后,将未标记数据发送到原始流进行自训练。每个流中包含两个用于3D和2D数据分别的编码器-解码器分支。每个流中,还探索了多个双模态融合模块用于融合双模态特征。此外,还探索了一个伪标签优化模块用于优化伪标签预测流的输出。在两个公开数据集上的实验结果表明,所提出的PD-Net不仅优于比较型半监督方法,而且在大多数情况下与一些完全监督方法表现相当。

关键词

引用

@article{arxiv.2409.13325,
  title  = {Towards Semi-supervised Dual-modal Semantic Segmentation},
  author = {Qiulei Dong and Jianan Li and Shuang Deng},
  journal= {arXiv preprint arXiv:2409.13325},
  year   = {2024}
}