揭秘秘方:小型 LLM 监督微调指南
机器学习
2024-12-19 v1 人工智能
机器学习
摘要
大型语言模型(LLM)的兴起造成了显著的差距:拥有计算资源、专家团队和先进基础设施的工业研究实验室能够有效地微调 LLM,而个人开发者和小型组织则因资源有限面临壁垒。在本文中,我们旨在通过提出一项关于使用跨越不同知识领域和技能的指令微调数据集对 LLM 进行监督微调的全面研究来弥合这一差距。我们专注于小型 LLM(3B 至 7B 参数),因为它们具有成本效益且易于获取。我们在四个开源预训练模型上探索了各种训练配置和策略。我们提供了这些配置的详细文档,揭示了挑战多项常见训练实践的发现,包括来自 TULU 的超参数建议和 Orca 推荐的分阶段训练。我们工作的主要见解包括: �更大的批大小配合更低的学习率能在 MMLU、MTBench 和 Open LLM Leaderboard 等基准上带来更好的模型性能; 早期训练动态,如较低的梯度范数和较高的损失值,是最终模型性能更佳的强烈指标,从而能够提前终止次优运行并显著节省计算资源; 通过对预热步数和学习率调度等超参数的深入探索,我们为从业者提供了指导,并发现某些简化操作并不会损害性能; 我们观察到分阶段训练与堆叠训练策略在性能上无显著差异,但堆叠训练更简单且样本效率更高。鉴于这些发现在不同数据集和模型上均保持稳健,我们希望本研究能作为从业者微调小型 LLM 的指南,并促进 LLM 研究更具包容性的环境。
引用
@article{arxiv.2412.13337,
title = {Unveiling the Secret Recipe: A Guide For Supervised Fine-Tuning Small LLMs},
author = {Aldo Pareja and Nikhil Shivakumar Nayak and Hao Wang and Krishnateja Killamsetty and Shivchander Sudalairaj and Wenlong Zhao and Seungwook Han and Abhishek Bhandwaldar and Guangxuan Xu and Kai Xu and Ligong Han and Luke Inglis and Akash Srivastava},
journal= {arXiv preprint arXiv:2412.13337},
year = {2024}
}
备注
33 pages, 19 figures. Appendix included in submission. Submitted to ICLR 2025