固定权重 Transformer 中的原语算法模拟
机器学习
2025-09-29 v2 人工智能
机器学习
摘要
我们证明,最小化 Transformer 具有冻结权重即可通过原语化来模拟广泛的算法类。我们形式化了两种原语化模式:在任务特定模式下,对于任意连续函数 ,我们展示存在单个单头 softmax 注意力层,其前向传播可对函数形式为 的函数进行任意精度的再现。这种通用模板包含许多流行的机器学习算法(如梯度下降、线性回归、岭回归)。在提示可编程模式下,我们证明了普遍性:单个固定权重的两层 softmax 注意力模块仅通过提示即可模拟来自任务特定类的全部算法(即由单个 softmax 注意力实现的每个算法)。我们的关键思想是构造编码算法参数的提示,以创建尖锐的点积间隙,使 softmax 注意力遵循预期计算。此构造无需前馈层且无需参数更新。所有适应性都通过提示alone 实现。数值结果证实了我们的理论。这一发现在原语学习与算法模拟之间建立了直接联系,为大型 Transformer 提供了一种简单机制,可作为提示可编程算法库使用。它们阐明了 GPT 类基础模型如何仅通过提示即可交换算法,并在现代 Transformer 模型中建立一种算法普遍性形式。
引用
@article{arxiv.2508.17550,
title = {In-Context Algorithm Emulation in Fixed-Weight Transformers},
author = {Jerry Yao-Chieh Hu and Hude Liu and Jennifer Yuntong Zhang and Han Liu},
journal= {arXiv preprint arXiv:2508.17550},
year = {2025}
}
备注
Code is available at https://github.com/MAGICS-LAB/algo_emu