分布偏移下的弱到强泛化
机器学习
2025-11-27 v2 人工智能
机器学习
摘要
随着未来超人类模型日益复杂,准确监督其行为可能超出人类能力。近期研究表明,在此类场景中,弱模型可以有效监督强模型,这一现象被称为弱到强泛化。然而,我们发现,在分布偏移下,朴素的弱到强泛化会失效,通常导致强模型的性能甚至不如其弱监督者。为解决此问题,我们提出RAVEN,一个鲁棒的弱到强泛化框架,该框架在优化强模型参数的同时,动态学习弱模型的最优组合。我们在图像分类、文本分类和偏好对齐任务上展示了RAVEN的有效性。在分布外任务上,RAVEN的性能优于替代基线方法超过30%,同时在分布内任务上匹配或超越现有方法。此外,我们的结果表明,RAVEN为更准确的弱模型分配更高的权重,展示了其自动识别可信监督的能力。
引用
@article{arxiv.2510.21332,
title = {Weak-to-Strong Generalization under Distribution Shifts},
author = {Myeongho Jeon and Jan Sobotka and Suhwan Choi and Maria Brbić},
journal= {arXiv preprint arXiv:2510.21332},
year = {2025}
}
备注
Accepted to NeurIPS 2025; affiliations and acknowledgements updated