中文

面向驾驶场景的弱监督语义分割

计算机视觉与模式识别 2024-01-19 v3

摘要

使用图像级标签的弱监督语义分割(WSSS)的最新技术在驾驶场景数据集(如Cityscapes)上表现出严重的性能下降。为了解决这一挑战,我们开发了一个针对驾驶场景数据集的新WSSS框架。基于对数据集特征的广泛分析,我们采用对比语言-图像预训练(CLIP)作为基线来获取伪掩码。然而,CLIP引入了两个关键挑战:(1)来自CLIP的伪掩码在表示小目标类别方面不足,(2)这些掩码包含显著的噪声。我们针对每个问题提出了如下解决方案。(1)我们设计了全局-局部视图训练,在模型训练期间无缝地融入小尺度补丁,从而增强模型处理驾驶场景中小而关键的目标(例如交通灯)的能力。(2)我们引入了一致性感知区域平衡(CARB),这是一种通过评估CLIP掩码与分割预测之间的一致性来辨别可靠和噪声区域的新技术。它通过自适应损失加权优先考虑可靠像素而非噪声像素。值得注意的是,所提出的方法在Cityscapes测试数据集上达到了51.8%的mIoU,展示了其作为驾驶场景数据集上强WSSS基线的潜力。在CamVid和WildDash2上的实验结果证明了我们的方法在不同数据集上的有效性,即使是在小规模数据集或视觉挑战性条件下。代码可在https://github.com/k0u-id/CARB获取。

关键词

引用

@article{arxiv.2312.13646,
  title  = {Weakly Supervised Semantic Segmentation for Driving Scenes},
  author = {Dongseob Kim and Seungho Lee and Junsuk Choe and Hyunjung Shim},
  journal= {arXiv preprint arXiv:2312.13646},
  year   = {2024}
}

备注

AAAI 2024 accepted. First two authors contributed equally