nGPT:基于球面上的表示学习的归一化 Transformer
机器学习
2025-04-25 v2 人工智能
摘要
我们提出了一种新型神经网络架构——归一化 Transformer(nGPT),其在球面上进行表示学习。在nGPT中,构成嵌入、MLP、注意力矩阵和隐藏状态的所有向量都进行单位范数归一化。输入的 token 流在多维球面上运行,每个层都对目标输出预测 contribute 一种位移,这些位移由 MLP 和注意力块定义,其向量分量也驻留在相同的球面上。实验表明,nGPT 学习速度更快, achieving 相同准确率所需的训练步数减少 4 至 20 倍,这取决于序列长度。
关键词
引用
@article{arxiv.2410.01131,
title = {nGPT: Normalized Transformer with Representation Learning on the Hypersphere},
author = {Ilya Loshchilov and Cheng-Ping Hsieh and Simeng Sun and Boris Ginsburg},
journal= {arXiv preprint arXiv:2410.01131},
year = {2025}
}