中文

EnsemW2S:利用大语言模型集成增强弱到强泛化

机器学习 2025-06-06 v2 计算与语言

摘要

随着大语言模型(LLMs)迅速逼近并可能超越人类水平性能,开发能够利用仅暴露于人类水平数据的较小、人类水平模型来有效监督和增强这些强大模型的方法,已成为当务之急。我们通过提出一种新方法来解决这一关键的弱到强(W2S)泛化挑战,该方法旨在通过在相同的有限人类水平数据上进行训练来改进弱专家,使其能够泛化到复杂的、超人类水平的任务。我们提出的方法称为 \textbf{EnsemW2S},采用一种 token 级别的集成策略,迭代地结合多个弱专家,系统地解决先前迭代中发现的缺陷。通过持续改进这些弱模型,我们显著增强了它们共同监督更强学生模型的能力。我们在分布内(ID)和分布外(OOD)数据集上广泛评估了弱专家集成和后续强学生模型的泛化性能。对于 OOD,我们专门引入问题难度作为定义分布偏移的额外维度。我们的实证结果表明了显著的改进,在 ID 数据集上分别实现了 4% 和 3.2% 的提升,在 OOD 数据集上分别实现了高达 6% 和 2.28% 的提升,这凸显了我们提出的方法在推进 W2S 泛化方面的有效性。

关键词

引用

@article{arxiv.2505.21959,
  title  = {EnsemW2S: Enhancing Weak-to-Strong Generalization with Large Language Model Ensembles},
  author = {Aakriti Agrawal and Mucong Ding and Zora Che and Chenghao Deng and Anirudh Satheesh and Bang An and Bayan Bruss and John Langford and Furong Huang},
  journal= {arXiv preprint arXiv:2505.21959},
  year   = {2025}
}

备注

Manuscript uploaded as version2 of arXiv:2410.04571