中文

固定权重 Transformer 中的原语算法模拟

机器学习 2025-09-29 v2 人工智能 机器学习

摘要

我们证明,最小化 Transformer 具有冻结权重即可通过原语化来模拟广泛的算法类。我们形式化了两种原语化模式:在任务特定模式下,对于任意连续函数 f:RRf: \mathbb{R} \to \mathbb{R},我们展示存在单个单头 softmax 注意力层,其前向传播可对函数形式为 f(wxy)f(w^\top x - y) 的函数进行任意精度的再现。这种通用模板包含许多流行的机器学习算法(如梯度下降、线性回归、岭回归)。在提示可编程模式下,我们证明了普遍性:单个固定权重的两层 softmax 注意力模块仅通过提示即可模拟来自任务特定类的全部算法(即由单个 softmax 注意力实现的每个算法)。我们的关键思想是构造编码算法参数的提示,以创建尖锐的点积间隙,使 softmax 注意力遵循预期计算。此构造无需前馈层且无需参数更新。所有适应性都通过提示alone 实现。数值结果证实了我们的理论。这一发现在原语学习与算法模拟之间建立了直接联系,为大型 Transformer 提供了一种简单机制,可作为提示可编程算法库使用。它们阐明了 GPT 类基础模型如何仅通过提示即可交换算法,并在现代 Transformer 模型中建立一种算法普遍性形式。

关键词

引用

@article{arxiv.2508.17550,
  title  = {In-Context Algorithm Emulation in Fixed-Weight Transformers},
  author = {Jerry Yao-Chieh Hu and Hude Liu and Jennifer Yuntong Zhang and Han Liu},
  journal= {arXiv preprint arXiv:2508.17550},
  year   = {2025}
}

备注

Code is available at https://github.com/MAGICS-LAB/algo_emu