Sloth: LLM技能的标度律以预测跨家族的多元基准性能
机器学习
2025-12-03 v5 人工智能
机器学习
摘要
大语言模型(LLMs)的标度律基于模型规模和训练数据等参数来预测模型性能。然而,不同模型家族之间训练配置和数据处理的差异导致基准性能存在显著差异,使得单一标度律难以泛化到所有LLM。另一方面,训练家族特定的标度律需要为每个家族训练不同规模的模型。在本工作中,我们提出了技能标度律(Skills Scaling Laws, SSLaws,发音为Sloth),一种利用公开可用基准数据并假设LLM性能由低维潜在技能(如推理和指令遵循)驱动的新型标度律。这些潜在技能受计算资源(如模型规模和训练token)的影响,但在不同模型家族中具有不同的效率。Sloth利用基准之间的相关性来提供更准确和可解释的预测,同时减轻了为每个家族训练多个LLM的需求。我们给出了参数识别的理论结果,并在Open LLM Leaderboard v1/v2的12个著名基准上进行了实证评估,结果表明Sloth能够准确预测LLM性能,并为复杂下游任务、增加测试时计算和技能的计算最优标度提供了洞见。
引用
@article{arxiv.2412.06540,
title = {Sloth: scaling laws for LLM skills to predict multi-benchmark performance across families},
author = {Felipe Maia Polo and Seamus Somerstep and Leshem Choshen and Yuekai Sun and Mikhail Yurochkin},
journal= {arXiv preprint arXiv:2412.06540},
year = {2025}
}
备注
NeurIPS 2025