中文

用于显式路径学习保证的高阶Transformer导数估计

机器学习 2025-02-07 v2 数值分析 神经与进化计算 数值分析 概率论 机器学习

摘要

计算Transformer的完全显式泛化边界的一个固有挑战是获得给定Transformer类TT的覆盖数估计。粗略估计依赖于TT中Transformer局部Lipschitz常数的统一上界,而更精细的估计需要分析其高阶偏导数。不幸的是,由于Transformer块复杂的组合结构,目前文献中缺乏对(实际)Transformer模型的这些精确高阶导数估计。本文通过精确估计Transformer模型的所有阶高阶导数填补了这一空白。我们考虑具有多个(非线性化)注意力头每块和层归一化的实际Transformer。我们根据注意力头数量、每个Transformer块的深度和宽度以及归一化层数,获得了所有常数的完全显式估计。此外,我们明确分析了各种标准激活函数选择(例如SWISH和GeLU)的影响。作为一个应用,我们获得了在固定未来时间范围内,Transformer在指数遍历马尔可夫过程的单条轨迹上的显式路径泛化边界。我们得出结论,现实世界的Transformer可以从单个马尔可夫过程轨迹的NN个(非独立同分布)样本中以O(polylog(N)/N){O}(\operatorname{polylog}(N)/\sqrt{N})的速率学习。

关键词

引用

@article{arxiv.2405.16563,
  title  = {Higher-Order Transformer Derivative Estimates for Explicit Pathwise Learning Guarantees},
  author = {Yannick Limmer and Anastasis Kratsios and Xuwei Yang and Raeid Saqur and Blanka Horvath},
  journal= {arXiv preprint arXiv:2405.16563},
  year   = {2025}
}

备注

11 pages (+30 appendix), 3 figures, 6 tables