中文

语言模型的物理学:第 3.3 部分,知识容量缩放定律

计算与语言 2024-04-09 v1 人工智能 机器学习

摘要

缩放定律描述了语言模型大小与其能力之间的关系。与以往通过损失或基准来评估模型能力的研究不同,我们估计了模型存储的知识比特数。我们专注于以元组表示的事实知识,例如 Wikipedia 页面中的(USA, capital, Washington D.C.)。通过多个受控数据集,我们确定语言模型能够且仅能够每个参数存储 2 比特的知识,即使在量化为 int8 时也是如此,并且这种知识可以灵活地提取用于下游应用。因此,根据我们的估计,一个 7B 模型可以存储 14B 比特的知识,超过了英文 Wikipedia 和教科书的总和。更广泛地说,我们提出了关于(1)训练持续时间、(2)模型架构、(3)量化、(4)稀疏性约束(如 MoE)和(5)数据信噪比如何影响模型知识存储容量的 12 项结果。值得注意的见解包括:* 带有旋转嵌入的 GPT-2 架构在知识存储方面与 LLaMA/Mistral 架构相匹配甚至超越,特别是在较短的训练持续时间内。这是因为 LLaMA/Mistral 使用 GatedMLP,其稳定性较差且更难训练。* 在训练数据前添加域名(例如 wikipedia.org)会显著增加模型的知识容量。语言模型能够自主识别并优先处理富含知识的领域,从而优化其存储容量。

关键词

引用

@article{arxiv.2404.05405,
  title  = {Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws},
  author = {Zeyuan Allen-Zhu and Yuanzhi Li},
  journal= {arXiv preprint arXiv:2404.05405},
  year   = {2024}
}