中文

SmolTulu:更高的学习率到批量大小比率可导致小型语言模型中的更好推理能力

计算与语言 2024-12-12 v1 人工智能

摘要

我们提出了 SmolTulu-1.7b-Instruct,本报告中其引用代号为 SmolTulu-DPO-1130,这是一款经过指令微调的语言模型,通过改进 AllenAI 的 Tulu 3 后训练管线,以增强 Huggingface 的 SmolLM2-1.7B 基础模型的性能。通过使用 1.35 亿参数模型进行全面实证分析,我们证明了学习率与批量大小之间的关系对模型性能具有显著且任务相关的影响。我们的发现显示出清晰的分界:类似 ARC 和 GSM8K 的推理任务受益于更高的学习率到批量大小比率,而像 HellaSwag 和 IFEval 这样的模式识别任务则在较低的比率下表现最佳。这些洞见引导我们开发了 SmolTulu,使其在指令遵循方面达到亚 20 亿参数模型的最佳性能,IFEval 测试得分达 67.7%(提升 11%),数学推理在 GSM8K 上得分 51.6%(提升 3.4%),另一版本在 ARC 上得分 57.1%(提升 5.4%)。我们发布了该模型、训练配方以及消除实验,以促进高效模型对齐领域的进一步研究,表明精心调整的优化动力学可帮助缩小小型和大型语言模型之间的能力差距。

关键词

引用

@article{arxiv.2412.08347,
  title  = {SmolTulu: Higher Learning Rate to Batch Size Ratios Can Lead to Better Reasoning in SLMs},
  author = {Sultan Alrashed},
  journal= {arXiv preprint arXiv:2412.08347},
  year   = {2024}
}

备注

10 pages, 4 figures, and 13 tables. For the SmolTulu-1.7b-instruct model, see: https://huggingface.co/SultanR/SmolTulu-1.7b-Instruct