弱到强的泛化:超越平方损失下的误差与收益关系
机器学习
2025-02-05 v2 概率论
摘要
弱到强的泛化范式指的是使用由弱 AI 模型标记的数据来训练强 AI 模型,目的是即使在弱监督下,强模型仍能在感兴趣的目标任务上超越其弱监督者。在以实值回归为目标、使用平方损失的设置下,近期工作定量地刻画了强模型相对于弱模型性能提升程度,具体方式是基于强弱模型之间的误差。我们将这种表述推广到损失函数对应任意 Bregman 发散的情况(当强类是凸的),这扩展了弱到强泛化中基于误差的性能提升表述,适用于分类任务,因为交叉熵损失可表示为 Bregman 发散。在实际情况下,强模型类可能不凸。因此,我们放宽假设,研究由强类中 k 个强模型的凸组合构成的弱到强泛化,在具体的分类设置下。这使我们能够获得类似的基于误差的性能提升表述,最多出现一个随 k 增大而消失的额外误差项。我们的理论发现得到了来自合成数据和真实数据集的充分实验支持。
关键词
引用
@article{arxiv.2501.19105,
title = {Relating Misfit to Gain in Weak-to-Strong Generalization Beyond the Squared Loss},
author = {Abhijeet Mulgund and Chirag Pabbaraju},
journal= {arXiv preprint arXiv:2501.19105},
year = {2025}
}
备注
22 pages, 4 figures