中文

EnsemW2S: 利用大语言模型集成增强弱到强泛化

机器学习 2025-07-24 v3

摘要

随着大语言模型迅速接近并可能超越人类水平的表现,开发能够使用仅接触人类级别数据的较小人类级别模型来有效监督和增强这些强大模型的方法变得势在必行。我们通过提出一种新颖的方法来解决这一关键的弱到强泛化挑战,该方法旨在通过在相同有限的人类级别数据上训练来改进弱专家,使其能够泛化到复杂的、超人类级别的任务。我们的方法称为**EnsemW2S**,采用一种令牌级别的集成策略,迭代地组合多个弱专家,系统地解决先前迭代中发现的缺点。通过不断改进这些弱模型,我们显著增强了它们监督更强学生模型的集体能力。我们在分布内和分布外数据集上广泛评估了弱专家集成以及后续强学生模型的泛化性能。对于分布外,我们特别引入问题难度作为定义分布偏移的额外维度。我们的实证结果显示出显著的改进,在分布内数据集上专家和学生模型分别实现了4%和3.2%的提升,在分布外数据集上分别实现了高达6%和2.28%的提升,强调了我们的方法在推进弱到强泛化方面的有效性。

关键词

引用

@article{arxiv.2410.04571,
  title  = {EnsemW2S: Enhancing Weak-to-Strong Generalization with Large Language Model Ensembles},
  author = {Aakriti Agrawal and Mucong Ding and Zora Che and Chenghao Deng and Anirudh Satheesh and Bang An and Bayan Bruss and John Langford and Furong Huang},
  journal= {arXiv preprint arXiv:2410.04571},
  year   = {2025}
}

备注

superalignment, weak-to-strong generalization on unseen OOD task; formerly appeared as arXiv:2505.21959v1 which was uploaded as a new submission in error