LLM 的容量密度规律
人工智能
2024-12-09 v2 计算与语言
摘要
大型语言模型(LLM)已然成为人工智能领域的里程碑,其性能随模型规模的增大而提升。然而,这种规模化带来了训练和推理效率的巨大挑战,尤其是在资源受限的环境中部署 LLM 时,规模化趋势日益难以持续。本文提出“容量密度”(capacity density)这一新概念,用作评估不同规模下 LLM 质量的指标,并从有效性与效率的角度描述 LLM 的发展趋势。为计算给定目标 LLM 的容量密度,本文首先引入一组参考模型,构建基于参数规模预测这些参考模型下游任务性能的 scaling law。随后定义目标 LLM 的“有效参数规模”(effective parameter size)为实现等效性能所需的参考模型参数规模,并将容量密度 formalized 为有效参数规模与目标 LLM 实际参数规模之比。容量密度提供了统一的框架,用于评估模型的有效性与效率。进一步分析近期开源基础 LLM,发现其容量密度随时间呈指数增长(densing law)。具体而言,使用广泛采用的基准测试,LLM 的容量密度约每三月翻倍一次。该规律为指导未来 LLM 发展提供新视角,强调提高容量密度以实现最小计算开销的关键。
引用
@article{arxiv.2412.04315,
title = {Densing Law of LLMs},
author = {Chaojun Xiao and Jie Cai and Weilin Zhao and Guoyang Zeng and Biyuan Lin and Jie Zhou and Zhi Zheng and Xu Han and Zhiyuan Liu and Maosong Sun},
journal= {arXiv preprint arXiv:2412.04315},
year = {2024}
}