PatchRefineNet:通过引入最优分块二值化信号改进二值分割
计算机视觉与模式识别
2023-09-13 v3
摘要
二值分割模型的目的是确定哪些像素属于感兴趣的目标(例如,图像中哪些像素属于道路)。模型为每个像素分配一个 logit 分数(即概率),并通过阈值化将其转换为预测(即每个 logit 分数 的像素被预测为道路的一部分)。然而,在当前和以往最先进的分割模型中,一个普遍现象是空间偏差——在某些图像块中,logit 分数持续偏高,而在其他块中持续偏低。这些偏差导致最终预测中出现假阳性和假阴性。本文提出 PatchRefineNet(PRN),一个位于基础分割模型之上、学习纠正其分块特定偏差的小型网络。在多种基础模型上,PRN 始终帮助其将 mIoU 提升 2-3%。PRN 背后的关键思想之一是在训练过程中加入一种新颖的监督信号。给定基础分割模型产生的 logit 分数,每个像素被赋予一个伪标签,该伪标签通过对每个图像块中的 logit 分数进行最优阈值化得到。将这些伪标签纳入 PRN 的损失函数有助于纠正系统性偏差并减少假阳性/假阴性。尽管我们主要关注二值分割,我们也展示了 PRN 如何扩展到显著性检测和少样本分割。我们还讨论了这些思想如何扩展到多类分割。
引用
@article{arxiv.2211.06560,
title = {PatchRefineNet: Improving Binary Segmentation by Incorporating Signals from Optimal Patch-wise Binarization},
author = {Savinay Nagendra and Chaopeng Shen and Daniel Kifer},
journal= {arXiv preprint arXiv:2211.06560},
year = {2023}
}
备注
16 pages, 12 figures, 7 tables (Added supplementary material)