中文

标准 Transformer 在 C^{s,\lambda} 目标下的非参数回归中实现最小混沌率

机器学习 2026-02-25 v1 信息论 机器学习 math.IT

摘要

Transformer 模型在大语言模型和计算机视觉等领域的巨大成功,迫切需要进行严格的理论调查。到目前为止,据我们所知,这是首个证明标准 Transformer 可在任意精度下近似 H"older 函数 Cs,λ([0,1]d×n) C^{s,\lambda}([0,1]^{d\times n}) sN0,0<λ1s \in \mathbb{N}_{\geq0}, 0<\lambda \leq 1)在 LtL^t 距离(t[1,]t \in [1, \infty])下的工作。建立在这些近似结果基础上,我们展示了标准 Transformer 在 H"older 目标函数的非参数回归中实现 minimax 最优速率。值得一提的是,通过引入两个度量:size 元组和维度向量,我们对 Transformer 结构进行了细粒度的表征,这有助于未来研究 Transformer 不同结构的泛化误差和优化误差。作为中间结果,我们还推导了标准 Transformer Lipschitz 常数上界以及其记忆容量,这可能是独立的兴趣。这些发现为 Transformer 模型的强大能力提供了理论依据。

关键词

引用

@article{arxiv.2602.20555,
  title  = {Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\lambda}$ Targets},
  author = {Yanming Lai and Defeng Sun},
  journal= {arXiv preprint arXiv:2602.20555},
  year   = {2026}
}

备注

58 pages, 1 figure