弱到强的迁移学习框架
机器学习
2025-03-17 v3 机器学习
摘要
现代大型语言模型(LLM)对齐技术依赖人类反馈,但这些技术是否根本限制了对齐 LLM 的能力尚不清楚。特别是,是否可以借助不如人类经验丰富的反馈来对齐(更强大的) LLM 而不降低其能力,这是弱到强的泛化问题:使用来自较弱(不如人类有经验)模型的反馈来训练较强(更有能力)模型。我们证明了弱到强的泛化是可能的,通过从预训练 LLM 中挖掘潜在知识。具体而言,我们将弱到强的泛化问题作为迁移学习问题,在此框架下,我们希望将潜在概念先验从弱模型转移到强预训练模型。我们证明了,粗略的微调方法存在根本性局限,但问题结构所暗示的另一种基于精炼的方法可克服微调的局限。最后,我们在多个 LLM 对齐任务中展示了精炼方法的实际应用性。
引用
@article{arxiv.2405.16236,
title = {A transfer learning framework for weak-to-strong generalization},
author = {Seamus Somerstep and Felipe Maia Polo and Moulinath Banerjee and Ya'acov Ritov and Mikhail Yurochkin and Yuekai Sun},
journal= {arXiv preprint arXiv:2405.16236},
year = {2025}
}
备注
v2: Major changes to set up, theory, and experiments v3: Camera ready