中文

技能的计算最优扩展:知识与推理

机器学习 2025-06-17 v3 人工智能 计算与语言

摘要

扩展定律是 LLM 开发流程中的关键组成部分,最著名的是作为预测训练决策(如'计算最优'地权衡参数数量与数据集大小)的方法,以及近期不断增长的其他关键决策列表。在这项工作中,我们询问计算最优的扩展行为是否可以是技能依赖的。特别是,我们考察了基于知识和基于推理的技能,如基于知识的问答和代码生成,并肯定地回答了这个问题:扩展定律是技能依赖的。接下来,为了理解技能依赖的扩展是否是预训练数据混合的产物,我们对不同的数据混合进行了广泛的消融实验,发现即使在纠正数据混合差异后,知识和代码在扩展行为上也表现出根本性差异。我们最后分析了我们的发现与使用验证集的标准计算最优扩展之间的关系,发现一个指定不当的验证集可能根据其技能组成影响计算最优参数数量近 50%。

关键词

引用

@article{arxiv.2503.10061,
  title  = {Compute Optimal Scaling of Skills: Knowledge vs Reasoning},
  author = {Nicholas Roberts and Niladri Chatterji and Sharan Narang and Mike Lewis and Dieuwke Hupkes},
  journal= {arXiv preprint arXiv:2503.10061},
  year   = {2025}
}