更小、更弱,却更好:通过计算最优采样训练大语言模型推理器
计算与语言
2024-10-10 v2 人工智能
摘要
在来自强大语言模型(LM)的高质量合成数据上进行训练,是提升 LM 推理性能的常用策略。在本工作中,我们重新审视在固定推理预算(如 FLOPs)下该策略是否是计算最优的。为此,我们研究了使用更强但更昂贵(SE)的模型与更弱但更便宜(WC)的模型生成合成数据之间的权衡。我们从三个关键指标评估生成的数据:覆盖率、多样性和假阳性率,并表明来自 WC 模型的数据可能具有更高的覆盖率和多样性,但也表现出更高的假阳性率。然后,我们在不同设置下对来自 SE 和 WC 模型的数据进行 LM 微调:知识蒸馏、自我提升,以及一种新颖的由弱到强提升设置,即较弱的 LM 向较强的 LM 教授推理。我们的发现表明,在多个基准测试以及多种 WC 和 SE 模型选择中,在 WC 生成数据上微调的模型始终优于在 SE 生成数据上训练的模型。这些结果挑战了依赖 SE 模型生成合成数据的普遍做法,表明 WC 可能是训练高级 LM 推理器的计算最优方法。
引用
@article{arxiv.2408.16737,
title = {Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling},
author = {Hritik Bansal and Arian Hosseini and Rishabh Agarwal and Vinh Q. Tran and Mehran Kazemi},
journal= {arXiv preprint arXiv:2408.16737},
year = {2024}
}