中文

伪标签如何影响半监督 Gibbs 算法的泛化误差

信息论 2023-06-16 v2 机器学习 math.IT

摘要

我们通过 Gibbs 算法对采用伪标签的半监督学习(SSL)的期望泛化误差(gen-error)给出了精确刻画。该泛化误差用输出假设、伪标签数据集与有标签数据集之间的对称化 KL 信息表示。也可获得与分布无关的泛化误差上下界。我们的发现提供了新的见解:采用伪标签的 SSL 的泛化性能不仅受输出假设与输入训练数据之间信息的影响,还受有标签与伪标签数据样本之间共享信息的影响。这可作为从给定方法族中选择合适伪标签方法的指导原则。为加深理解,我们进一步探讨了两个例子——均值估计与逻辑回归。特别地,我们分析了两种情形下未标记与已标记数据数量之比 λ\lambda 如何影响泛化误差。随着 λ\lambda 增大,均值估计的泛化误差先减小,然后饱和于一个大于全样本标记时的值,该差距可用我们的分析精确量化,并依赖于有标签与伪标签数据样本之间的交叉协方差。对于逻辑回归,泛化误差与超额风险的方差分量也随 λ\lambda 增大而减小。

关键词

引用

@article{arxiv.2210.08188,
  title  = {How Does Pseudo-Labeling Affect the Generalization Error of the Semi-Supervised Gibbs Algorithm?},
  author = {Haiyun He and Gholamali Aminian and Yuheng Bu and Miguel Rodrigues and Vincent Y. F. Tan},
  journal= {arXiv preprint arXiv:2210.08188},
  year   = {2023}
}

备注

30 pages, 4 figures