Transformer 能在多大程度上模拟上下文牛顿法?
机器学习
2024-03-06 v1 人工智能
最优化与控制
机器学习
摘要
基于Transformer的模型展现出了卓越的上下文学习能力,促使人们对其底层机制进行了广泛研究。近期研究表明,Transformer能够实现用于上下文学习的一阶优化算法,甚至在线性回归情况下实现二阶优化算法。在本工作中,我们研究Transformer能否执行超越线性回归情况的高阶优化方法。我们证明,带有ReLU层的线性注意力Transformer可以近似逻辑回归任务中的二阶优化算法,并且仅需与误差呈对数关系的更多层即可实现 误差。作为副产品,我们证明了甚至仅有线性注意力的Transformer也能仅用两层实现用于矩阵求逆的单步牛顿迭代。这些结果表明,Transformer架构具备实现超越梯度下降的复杂算法的能力。
关键词
引用
@article{arxiv.2403.03183,
title = {How Well Can Transformers Emulate In-context Newton's Method?},
author = {Angeliki Giannou and Liu Yang and Tianhao Wang and Dimitris Papailiopoulos and Jason D. Lee},
journal= {arXiv preprint arXiv:2403.03183},
year = {2024}
}