中文

半监督学习中伪标签选择的置信度-方差理论

机器学习 2026-02-27 v2 人工智能

摘要

半监督学习中的大多数伪标签选择策略依赖于固定的置信度阈值,隐含地假设预测置信度能可靠地指示正确性。在实践中,深度网络通常过度自信:高置信度预测仍然可能是错误的,而决策边界附近信息丰富的低置信度样本则被丢弃。本文引入了置信度-方差 理论框架,为伪标签选择提供了有原则的联合可靠性标准。从熵最小化原则出发,我们推导出了一种结合最大置信度 (MC) 和残差类方差 (RCV) 的可靠性度量,其中残差类方差表征了概率质量在非最大类上的分布情况。推导表明,可靠的伪标签应同时具有高 MC 和低 RCV,且 RCV 的影响随置信度增加而增大,从而纠正了过度自信但不稳定的预测。从这个角度出发,我们将伪标签选择转化为一个在置信度-方差特征空间中最大化可分性的谱松弛问题,并设计了一种无阈值选择机制来区分高可靠性和低可靠性预测。我们将 CoVar 作为即插即用模块集成到代表性的半监督语义分割和图像分类方法中。在具有不同标签比例和主干网络的 PASCAL VOC 2012、Cityscapes、CIFAR-10 和 Mini-ImageNet 上,它持续优于强基线,表明将置信度与残差类方差相结合为伪标签选择提供了比固定置信度阈值更可靠的基础。(代码:https://github.com/ljs11528/CoVar_Pseudo_Label_Selection.git)

关键词

引用

@article{arxiv.2601.11670,
  title  = {A Confidence-Variance Theory for Pseudo-Label Selection in Semi-Supervised Learning},
  author = {Jinshi Liu and Pan Liu and Lei He},
  journal= {arXiv preprint arXiv:2601.11670},
  year   = {2026}
}