线性注意力(或许)就是你理解 Transformer 优化所需的一切
机器学习
2024-03-14 v2 人工智能
最优化与控制
摘要
Transformer 训练 notoriously 困难,需要精心设计优化器并使用各种启发式方法。我们通过仔细研究一个简单但典型的线性化浅层 Transformer 模型,在理解 Transformer 训练的微妙之处方面取得进展。具体而言,受 J.~von Oswald 等人(ICML 2023)与 K.~Ahn 等人(NeurIPS 2023)启发,我们训练线性 Transformer 以解决回归任务。最重要的是,我们观察到所提出的线性化模型能够复现 Transformer 训练动态的若干显著方面。因此,本文所得结果表明,一个简单的线性化 Transformer 模型实际上可能成为理解 Transformer 优化的有价值的、现实的抽象。
引用
@article{arxiv.2310.01082,
title = {Linear attention is (maybe) all you need (to understand transformer optimization)},
author = {Kwangjun Ahn and Xiang Cheng and Minhak Song and Chulhee Yun and Ali Jadbabaie and Suvrit Sra},
journal= {arXiv preprint arXiv:2310.01082},
year = {2024}
}
备注
Published at ICLR 2024