中文

现代Transformer模块中的上下文与参数更新等价性

机器学习 2025-12-24 v2

摘要

近期研究表明,vanilla Transformer中的上下文影响可通过在其MLP权重上形成由token依赖的秩1补丁来隐式表示。本工作将该基础理论扩展到现代大型语言模型的多样化架构。我们首先给出Gemma式Transformer模块的精确解析解,证明上下文的整个效果可完美映射到其MLP权矩阵上的秩1补丁以及RMSNorm比例的补丁。随后,我们提供更一般的证明,提出一种通用框架,核心是输入可控性和输出可控性两个基本属性。我们证明,只要MLP模块的内部函数是输入可控的、外部函数是输出可控的,就可能实现完美的隐式权重补丁。这为理解Transformer模型如何将提示转化为有效权重提供了更简单且更强大的视角。该框架可推广至包括门控、前/后规范、专家混合以及顺序/并行Transformer模块的广泛现代LLM架构。

关键词

引用

@article{arxiv.2511.17864,
  title  = {Equivalence of Context and Parameter Updates in Modern Transformer Blocks},
  author = {Adrian Goldwaser and Michael Munn and Javier Gonzalvo and Benoit Dherin},
  journal= {arXiv preprint arXiv:2511.17864},
  year   = {2025}
}