中文

Transformer 可实现 preconditioned Richardson 迭代用于In-Context 高斯核回归

机器学习 2026-05-19 v2 人工智能 数值分析 数值分析 最优化与控制

摘要

机制学对In-Context学习(ICL)的解释已识别出线性回归及相关线性预测任务的迭代算法,常采用线性或ReLU注意力变体。对于非线性ICL,先前工作将softmax与核化注意力关联至函数梯度型动力学,但仍不清楚标准Transformer(即带softmax注意力)能否实现具有端到端预测误差保证的收敛求解器。本文研究使用高斯核的In-Context核岩回归(KRR),我们证明标准softmax注意力Transformer可通过在相关核线性系统上实现preconditioned Richardson迭代来近似KRR预测器。在有界数据假设下,我们构建单个头Transformer,其块数为O(log(1/ϵ))O(\log(1/\epsilon)),MLP宽度为O(N/ϵ)O(\sqrt{N/\epsilon}),可在提示长度为NN时实现ϵ\epsilon精度预测。我们的构造揭示了Transformer架构中的函数分解:softmax注意力产生行归一化的高斯核算子,用于跨token互动,而ReLU MLP层在局部近似满足更新所需的token内标量算术。经验上,我们在高斯过程回归任务中训练GPT-2风格Transformer,以进一步测试preconditioned Richardson解释。通过线性探针,我们比较Transformer的层级预测与经典KRR求解器的步骤输出,发现其误差轮廓最一致地与preconditioned Richardson迭代匹配。消融研究进一步支持此解释。综上,我们的理论与实验确定preconditioned Richardson迭代是Transformer实现非线性In-Context高斯核回归的具体机制。

关键词

引用

@article{arxiv.2605.08475,
  title  = {Transformers Can Implement Preconditioned Richardson Iteration for In-Context Gaussian Kernel Regression},
  author = {Mingsong Yan and Dongyang Li and Charles Kulick and Sui Tang},
  journal= {arXiv preprint arXiv:2605.08475},
  year   = {2026}
}