固定计算预算下大语言模型微调中 Token 效率的缩放定律
计算与语言
2025-06-04 v2 人工智能
摘要
我们引入了一个在固定计算预算下微调大语言模型 (LLM) 的缩放定律,该定律显式地考虑了数据构成。传统方法仅通过总 token 数来衡量训练数据,然而样本数量及其平均 token 长度——我们称之为数据集容量——对模型性能起着决定性作用。我们的公式遵循既定程序进行调整。在 BRICC 数据集和 MMLU 数据集的子集上进行的实验,在多种子采样策略下评估,揭示了数据构成显著影响 token 效率。这些结果促使我们为资源受限环境下的实际 LLM 微调提出更精细的缩放定律。
引用
@article{arxiv.2505.06150,
title = {A Scaling Law for Token Efficiency in LLM Fine-Tuning Under Fixed Compute Budgets},
author = {Ryan Lagasse and Aidan Kierans and Avijit Ghosh and Shiri Dori-Hacohen},
journal= {arXiv preprint arXiv:2505.06150},
year = {2025}
}