通过概率原型像素对比减少域自适应语义分割中的语义模糊
计算机视觉与模式识别
2024-10-30 v1
摘要
域自适应旨在减少由源域和目标域之间的域偏移导致的目标域上模型性能的退化。尽管将认知学习与自训练范式相结合已取得了令人鼓舞的性能,但在部署确定性嵌入时,它们在处理由尺度、光照或重叠引起的模糊场景时仍存在困难。为了解决这些问题,我们提出了概率原型像素对比(PPPC),这是一种通用的自适应框架,通过多元高斯分布将每个像素嵌入建模为概率,以充分利用其中的不确定性,最终提升模型的表示质量。此外,我们从概率估计的后验概率估计中推导出原型,这有助于将决策边界推离模糊点。而且,我们采用了一种高效的方法来计算分布之间的相似度,无需采样和重参数化,从而显著降低了计算开销。进一步地,我们在图像层面动态选择模糊裁剪区域,以增加参与对比学习的边界点数量,这有利于为每个类别建立精确的分布。大量实验表明,PPPC 不仅有助于解决像素级的模糊问题并产生具有判别性的表示,还在合成到真实和日到夜的自适应任务中均取得了显著提升。在最具挑战性的日到夜自适应场景中,它以 +5.2% mIoU 超越了先前最先进的 SOTA,在其他未见数据集上展现出更强的泛化能力。代码和模型可在 https://github.com/DarlingInTheSV/Probabilistic-Prototypical-Pixel-Contrast 获取。
引用
@article{arxiv.2409.18543,
title = {Reducing Semantic Ambiguity In Domain Adaptive Semantic Segmentation Via Probabilistic Prototypical Pixel Contrast},
author = {Xiaoke Hao and Shiyu Liu and Chuanbo Feng and Ye Zhu},
journal= {arXiv preprint arXiv:2409.18543},
year = {2024}
}
备注
revise