Transformer 可实现 preconditioned Richardson 迭代用于In-Context 高斯核回归
机器学习
2026-05-19 v2 人工智能
数值分析
数值分析
最优化与控制
摘要
机制学对In-Context学习(ICL)的解释已识别出线性回归及相关线性预测任务的迭代算法,常采用线性或ReLU注意力变体。对于非线性ICL,先前工作将softmax与核化注意力关联至函数梯度型动力学,但仍不清楚标准Transformer(即带softmax注意力)能否实现具有端到端预测误差保证的收敛求解器。本文研究使用高斯核的In-Context核岩回归(KRR),我们证明标准softmax注意力Transformer可通过在相关核线性系统上实现preconditioned Richardson迭代来近似KRR预测器。在有界数据假设下,我们构建单个头Transformer,其块数为,MLP宽度为,可在提示长度为时实现精度预测。我们的构造揭示了Transformer架构中的函数分解:softmax注意力产生行归一化的高斯核算子,用于跨token互动,而ReLU MLP层在局部近似满足更新所需的token内标量算术。经验上,我们在高斯过程回归任务中训练GPT-2风格Transformer,以进一步测试preconditioned Richardson解释。通过线性探针,我们比较Transformer的层级预测与经典KRR求解器的步骤输出,发现其误差轮廓最一致地与preconditioned Richardson迭代匹配。消融研究进一步支持此解释。综上,我们的理论与实验确定preconditioned Richardson迭代是Transformer实现非线性In-Context高斯核回归的具体机制。
引用
@article{arxiv.2605.08475,
title = {Transformers Can Implement Preconditioned Richardson Iteration for In-Context Gaussian Kernel Regression},
author = {Mingsong Yan and Dongyang Li and Charles Kulick and Sui Tang},
journal= {arXiv preprint arXiv:2605.08475},
year = {2026}
}