量化弱到强的泛化提升
机器学习
2024-10-24 v2 人工智能
摘要
近期大语言模型的进展展现出惊人的且接近超人类的能力。这些模型 operating with such complexity that reliably evaluating and aligning them proves challenging for humans。这导致自然的问题:弱模型(如人类)的指导是否足以引导强模型的能力?在近期且有时令人惊讶的工作中,Burns 等人 (2023) 实证表明,当强模型(如 GPT-4)使用由弱监督者(如 GPT-2)生成的标签进行 fine-tuning 时,强模型会超过其较弱的对手——他们将这种现象称为 weak-to-strong generalization。在本工作中,我们提出了一种理解 weak-to-strong generalization 的理论框架。具体而言,我们表明强模型相对于其较弱对手所实现的性能提升由强模型对弱模型生成的标签所产生的 misfit error 所量化。我们的理论揭示了若干有趣的算法见解。例如,我们可以预测强模型将如何改进其性能,也可以在基于其 misfit error 选择不同的弱模型来训练强模型。我们通过各种实证评估验证了我们的理论发现。
引用
@article{arxiv.2405.15116,
title = {Quantifying the Gain in Weak-to-Strong Generalization},
author = {Moses Charikar and Chirag Pabbaraju and Kirankumar Shiragur},
journal= {arXiv preprint arXiv:2405.15116},
year = {2024}
}
备注
19 pages; NeurIPS 2024 camera-ready version with additional experiments, references and discussion