论弱到强泛化的涌现:偏差-方差视角
机器学习
2025-09-30 v2
摘要
弱到强泛化是指强学生模型在由弱教师标注的数据集上训练后,最终在目标任务上超越教师模型的现象。最近的研究将这种性能提升归因于学生模型与教师模型之间的预测失配。在这项工作中,我们通过 Bregman 散度的广义偏差-方差分解,从理论上研究了 W2SG 的涌现。具体而言,我们表明学生与教师之间的期望总体风险差距由两个模型之间的期望失配来量化。虽然这与之前的结果一致,但我们的分析去除了早期工作所需的几个限制性假设,最显著的是学生假设类的凸性。此外,我们表明当学生模型近似其后验均值教师,而不是模仿单个教师时,W2SG 更有可能涌现。通过一个具体例子,我们证明如果学生模型规模足够大,它确实能在期望意义上收敛到后验均值教师。我们的分析还表明,避免对教师监督的过拟合并降低学生预测的熵会进一步促进 W2SG。此外,我们表明与标准的前向交叉熵不同,反向交叉熵损失对教师的预测不确定性不太敏感。最后,我们从经验上验证了我们的理论见解,并证明结合反向交叉熵损失能持续提升学生性能。
引用
@article{arxiv.2505.24313,
title = {On the Emergence of Weak-to-Strong Generalization: A Bias-Variance Perspective},
author = {Gengze Xu and Wei Yao and Ziqiao Wang and Yong Liu},
journal= {arXiv preprint arXiv:2505.24313},
year = {2025}
}