中文

重构半监督分割:超越准确性,关注可靠性与鲁棒性

计算机视觉与模式识别 2025-06-09 v1 人工智能 机器学习

摘要

语义分割是场景理解的关键任务,但需要高成本的像素级标注,吸引越来越多的注意力转向半监督方法以利用丰富的无标签数据。虽然半监督分割常被宣传为通向可规模化、真实场景部署的路径,但令人惊讶的是,当前的评估协议仅关注分割准确性,完全忽略了可靠性和鲁棒性这两个重要指标。这两种特性分别确保了模型在多样化条件下的一致性能(鲁棒性)以及良好校准的模型置信度和有意义的不确定性(可靠性),对于安全关键型应用(如自动驾驶)至关重要,因为模型必须处理不可预测的环境并避免任何突发性失效。为此,我们引入可靠分割得分(RSS),一种新颖的度量指标,通过调和平均数将预测准确性、校准程度和不确定性质量度量相结合。RSS对任何组成部分的缺陷都会进行惩罚,为整体判断分割模型提供了简便直观的方式。对UniMatchV2进行全面评估,与其前身及监督基线相比显示,半监督方法往往以牺牲可靠性来换取准确性。虽然外域评估表明UniMatchV2具有鲁棒性,但进一步揭示了持久的可靠性不足。我们主张转向更整体性的评估指标(如RSS),以更好地将半监督学习研究与实际部署需求对齐。

关键词

引用

@article{arxiv.2506.05917,
  title  = {Rethinking Semi-supervised Segmentation Beyond Accuracy: Reliability and Robustness},
  author = {Steven Landgraf and Markus Hillemann and Markus Ulrich},
  journal= {arXiv preprint arXiv:2506.05917},
  year   = {2025}
}