弱到强的泛化理论分析
机器学习
2024-05-28 v1 计算与语言
机器学习
摘要
强学生模型可以在较弱的教师模型的指导下学习:当在较弱模型的预测上进行训练时,强的预训练学生模型可以学习纠正弱教师模型的错误,并泛化到教师模型置信度不高的示例上,即使这些示例被排除在训练之外。这使得可以从廉价、不完整且可能不正确的标签信息中进行学习,例如粗糙的逻辑规则或语言模型的生成。我们指出,现有的弱监督理论未能解释这两种效应,我们称为伪标签纠正和覆盖率扩展。我们提出了一种新的上界,基于数据分布和学生假设类中的扩张特性,直接解释伪标签纠正和覆盖率扩展。我们的上界捕捉了弱到强泛化发生的直觉,即当强模型无法在不增加额外误差的情况下拟合弱教师的错误时。我们指出,这些扩张特性可以从有限数据中检查,并给出实际中的经验证据。
引用
@article{arxiv.2405.16043,
title = {Theoretical Analysis of Weak-to-Strong Generalization},
author = {Hunter Lang and David Sontag and Aravindan Vijayaraghavan},
journal= {arXiv preprint arXiv:2405.16043},
year = {2024}
}
备注
36 pages, 3 figures