中文

多样化与征服:利用开集分歧实现针对异常值的鲁棒半监督学习

计算机视觉与模式识别 2025-06-02 v1 机器学习

摘要

传统的半监督学习(SSL)理想地假设标记数据和未标记数据共享相同的类别分布,然而在实践中,这一假设很容易被打破,因为未标记数据通常包含未知类别的数据,即异常值。异常值被视为噪声,极大地降低了 SSL 模型的性能。为了解决这一缺陷,我们提出了一个新颖的框架——多样化与征服(DAC),以增强开集半监督学习背景下的 SSL 鲁棒性。特别地,我们注意到现有的开集 SSL 方法依赖于在标记数据上训练的单个模型对内点和异常值的预测差异。当标记数据不足时,这种方法很容易失败,导致性能下降,甚至比不考虑异常值的朴素 SSL 还要差。相比之下,我们的方法利用了多个对未标记分布有不同偏置的模型之间的预测分歧。通过利用未标记数据训练产生的差异,我们的方法即使在标记数据不充分的情况下也能实现鲁棒的异常值检测。我们的核心贡献是通过单次训练过程构建了一组具有不同偏置的模型。通过鼓励发散的预测头对异常值产生不同的偏置,同时对内点做出一致的预测,我们利用这些头之间的分歧作为识别未知概念的度量。我们的代码可在 https://github.com/heejokong/DivCon 获取。

关键词

引用

@article{arxiv.2505.24443,
  title  = {Diversify and Conquer: Open-set Disagreement for Robust Semi-supervised Learning with Outliers},
  author = {Heejo Kong and Sung-Jin Kim and Gunho Jung and Seong-Whan Lee},
  journal= {arXiv preprint arXiv:2505.24443},
  year   = {2025}
}

备注

Accepted by IEEE Transactions on Neural Networks and Learning Systems (TNNLS)