中文

Transformer 能在多大程度上模拟上下文牛顿法?

机器学习 2024-03-06 v1 人工智能 最优化与控制 机器学习

摘要

基于Transformer的模型展现出了卓越的上下文学习能力,促使人们对其底层机制进行了广泛研究。近期研究表明,Transformer能够实现用于上下文学习的一阶优化算法,甚至在线性回归情况下实现二阶优化算法。在本工作中,我们研究Transformer能否执行超越线性回归情况的高阶优化方法。我们证明,带有ReLU层的线性注意力Transformer可以近似逻辑回归任务中的二阶优化算法,并且仅需与误差呈对数关系的更多层即可实现 ϵ\epsilon 误差。作为副产品,我们证明了甚至仅有线性注意力的Transformer也能仅用两层实现用于矩阵求逆的单步牛顿迭代。这些结果表明,Transformer架构具备实现超越梯度下降的复杂算法的能力。

关键词

引用

@article{arxiv.2403.03183,
  title  = {How Well Can Transformers Emulate In-context Newton's Method?},
  author = {Angeliki Giannou and Liu Yang and Tianhao Wang and Dimitris Papailiopoulos and Jason D. Lee},
  journal= {arXiv preprint arXiv:2403.03183},
  year   = {2024}
}