YuriiFormer:一套纳德诺加速变换器
机器学习
2026-03-06 v2 人工智能
最优化与控制
机器学习
摘要
我们提出了一个变量框架,将变换器层解释为作用于词嵌入上的优化算法的迭代。在此观点下,自注意力实现了相互作用能量的梯度步骤,而MLP层对应于势能的梯度更新。标准GPT风格的变换器可视为对结果复合目标的普通梯度下降,通过Lie--Trotter分割实现这两种能量函数之间的梯度更新。这种视角使我们能够使用经典优化思想进行原则性的架构设计。作为一种示例,我们引入一种纳德诺式加速变换器,保持相同的注意力和MLP oracle。 resulting architecture 在 TinyStories 和 OpenWebText 上 consistently outperform nanoGPT 基线,表明优化理论见解可转化为实际收益。
引用
@article{arxiv.2601.23236,
title = {YuriiFormer: A Suite of Nesterov-Accelerated Transformers},
author = {Aleksandr Zimin and Yury Polyanskiy and Philippe Rigollet},
journal= {arXiv preprint arXiv:2601.23236},
year = {2026}
}