中文

利用集成多样性在样本选择偏差下进行鲁棒自训练

机器学习 2024-04-04 v4 人工智能 机器学习

摘要

自训练是一种众所周知的半监督学习方法。它由迭代地为模型置信度高的未标注数据分配伪标签并将其视为有标注样本组成。对于神经网络,softmax 预测概率常被用作置信度度量,尽管已知其即便对于错误预测也过于自信。这种现象在存在样本选择偏差(即数据标注受某些约束)时尤为加剧。为解决此问题,我们提出了一种称为 T\mathcal{T}-相似度(T\mathcal{T}-similarity)的新颖置信度度量,其构建于线性分类器集成的预测多样性之上。我们通过研究驻点并描述个体成员多样性与其性能之间的关系,对方法进行了理论分析。我们在不同数据模态的分类数据集上,针对三种不同的伪标注策略实证展示了该置信度度量的益处。代码见 https://github.com/ambroiseodt/tsim。

关键词

引用

@article{arxiv.2310.14814,
  title  = {Leveraging Ensemble Diversity for Robust Self-Training in the Presence of Sample Selection Bias},
  author = {Ambroise Odonnat and Vasilii Feofanov and Ievgen Redko},
  journal= {arXiv preprint arXiv:2310.14814},
  year   = {2024}
}

备注

Accepted at AISTATS 2024, Valencia, Spain