大语言模型架构、规模律与经济学:快速概述
综合文献
2025-11-18 v1 计算与语言
机器学习
摘要
当前大语言模型(LLM)的标准架构采用 QKV 自注意力机制,以下述典型 Transformer 架构为例进行概述。给出计算(flops)和内存(参数加数据)的规模律,并提供其 2025 年的粗略成本估算,涵盖各种规模的 LLM 参数成本,讨论 DeepSeek 是否应被视为特例。此处并无新内容,但此类材料似乎难以获得其他概述形式。
引用
@article{arxiv.2511.11572,
title = {LLM Architecture, Scaling Laws, and Economics: A Quick Summary},
author = {William H. Press},
journal= {arXiv preprint arXiv:2511.11572},
year = {2025}
}
备注
9 pages, 3 figures