Transformer 实现函数空间梯度下降以在上下文中学习非线性函数
机器学习
2024-06-05 v6
摘要
许多神经网络架构已知是图灵完备的,因此原则上可以实现任意算法。然而,Transformer 的独特之处在于它们可以在简单的参数配置下实现基于梯度的学习算法。本文提供了理论和实证证据,表明(非线性)Transformer 自然地学会在函数空间中实现梯度下降,这反过来使它们能够在上下文中学习非线性函数。我们的结果适用于广泛的非线性架构与非线性上下文学习任务的组合。此外,我们证明了非线性激活的最优选择以一种自然的方式依赖于需要学习的函数类别。
引用
@article{arxiv.2312.06528,
title = {Transformers Implement Functional Gradient Descent to Learn Non-Linear Functions In Context},
author = {Xiang Cheng and Yuxin Chen and Suvrit Sra},
journal= {arXiv preprint arXiv:2312.06528},
year = {2024}
}