伪标签在高维高斯混合数据上自训练线性分类器中的作用
机器学习
2024-05-08 v3 无序系统与神经网络
统计力学
机器学习
统计理论
统计理论
摘要
自训练(ST)是一种简单而有效的半监督学习方法。然而,ST 为何以及如何利用潜在错误的伪标签提升泛化性能仍未被充分理解。为加深对 ST 的理解,我们推导并分析了在输入维度与数据量成比例发散的渐近极限下,通过在二元高斯混合上最小化岭正则凸损失训练线性分类器时迭代 ST 行为的精确刻画。结果表明,ST 根据迭代次数以不同方式改善泛化。当迭代次数较少时,ST 通过将模型拟合到相对可靠的伪标签并在每次迭代中以较大幅度更新模型参数来提升泛化性能,这表明 ST 直观起效。另一方面,在多次迭代下,ST 可利用软标签与小正则化,通过增量更新模型参数逐步改善分类平面的方向。我们认为这是因为 ST 的小更新能以近乎无噪的方式从数据中提取信息。然而,在存在标签不平衡时,ST 的泛化性能不及使用真实标签的监督学习。为克服此问题,提出了两种启发式方法,使 ST 即使在显著标签不平衡下也能达到与监督学习近乎相当的性能。
引用
@article{arxiv.2205.07739,
title = {The Role of Pseudo-labels in Self-training Linear Classifiers on High-dimensional Gaussian Mixture Data},
author = {Takashi Takahashi},
journal= {arXiv preprint arXiv:2205.07739},
year = {2024}
}
备注
65 pages, 13 figures