中文

语言模型的物理学: 第 4.1 部分, 架构设计与 Canon 层的魔力

计算与语言 2025-12-22 v1

摘要

理解语言模型在架构差异方面具有挑战性, 尤其是在学术规模的预训练中(例如 13 亿参数, 1000 亿标记), 在此情况下结果常常被噪声和随机性主导。为克服这一困难, 我们引入了受控的人造合成预训练任务, 以隔离和评估核心模型能力。在此框架内, 我们发现了 CANON 层: 一种轻量级的架构组件--以音乐术语"Canon"命名--促进相邻标记之间水平信息流。Canon 层计算相邻 token 表示的加权求和, 并可无缝集成到 Transformer、线性注意力、状态空间模型或任何序列架构中。我们提出了 12 项关键结果。这包括 Canon 层如何增强推理深度(例如提高 2×2\times)、推理宽度、知识操作等。它们将诸如 NoPE 这类弱架构提升至与 RoPE 相当的水平, 将线性注意力提升至与 Mamba2/GDN 等最先进线性模型相抗衡--通过人造合成任务和真实世界学术规模预训练进行验证。这一人造合成场所提供了一种经济、原则化的路径, 以隔离常被学术规模掩盖的核心模型能力。凭借无限高质量数据, 它甚至可能 PREDICT 未来架构在训练管道改进后(例如通过更好的数据精选或基于 RL 的后训练)将如何表现--从而实现更深入的推理和层次推理。

关键词

引用

@article{arxiv.2512.17351,
  title  = {Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers},
  author = {Zeyuan Allen-Zhu},
  journal= {arXiv preprint arXiv:2512.17351},
  year   = {2025}
}

备注

V1.1 appeared in NeurIPS 2025 main conference; V2 adds GDN experiments, tightens some experiments (for a stronger, fairer comparison), and re-organizes sections