Boxes2Pixels:从噪声 SAM 掩码学习缺陷分割
计算机视觉与模式识别
2026-04-14 v1
摘要
精确的缺陷分割对于工业检验至关重要,但稀缺的像素级标注几乎不可得。常见的做法是将廉价的边界框转换为基于如 Segment Anything Model (SAM) 等基础分割模型的伪掩码。然而,这些伪标签在工业表面上存在系统性噪声,常在背景结构中幻觉化,而错失稀疏缺陷。为此提出一种面向噪声的盒子到像素蒸馏框架,称为 Boxes2Pixels,将 SAM 视为噪声老师而非真实监督来源。边界框通过 SAM 离线转换为伪掩码,紧凑的学生模型在 (i) 采用冻结 DINOv2 特征的层次解码器以实现语义稳定性、(ii) 引入辅助的二值定位头以解耦稀疏前景发现与类别预测、(iii) 采用一种单向在线自纠正机制,当学生自信时放宽背景监督,针对老师的假阴性。实验在手动标注的风力发电机检验基准上表明,Boxes2Pixels 在异常 mIoU 上提升 +6.97,在二值 IoU 上提升 +9.71,显著优于在相同弱监督条件下的最强基线。此外,线上自纠正使二值召回率提升 +18.56,而该模型使用的可训练参数减少了 80%。代码已公开于 https://github.com/CLendering/Boxes2Pixels。
引用
@article{arxiv.2604.11162,
title = {Boxes2Pixels: Learning Defect Segmentation from Noisy SAM Masks},
author = {Camile Lendering and Erkut Akdag and Egor Bondarev},
journal= {arXiv preprint arXiv:2604.11162},
year = {2026}
}
备注
Accepted for presentation at the AI4RWC Workshop at CVPR 2026