中文

固定计算预算下大语言模型微调中 Token 效率的缩放定律

计算与语言 2025-06-04 v2 人工智能

摘要

我们引入了一个在固定计算预算下微调大语言模型 (LLM) 的缩放定律,该定律显式地考虑了数据构成。传统方法仅通过总 token 数来衡量训练数据,然而样本数量及其平均 token 长度——我们称之为数据集容量——对模型性能起着决定性作用。我们的公式遵循既定程序进行调整。在 BRICC 数据集和 MMLU 数据集的子集上进行的实验,在多种子采样策略下评估,揭示了数据构成显著影响 token 效率。这些结果促使我们为资源受限环境下的实际 LLM 微调提出更精细的缩放定律。

关键词

引用

@article{arxiv.2505.06150,
  title  = {A Scaling Law for Token Efficiency in LLM Fine-Tuning Under Fixed Compute Budgets},
  author = {Ryan Lagasse and Aidan Kierans and Avijit Ghosh and Shiri Dori-Hacohen},
  journal= {arXiv preprint arXiv:2505.06150},
  year   = {2025}
}