Transformer中ReLU与Softmax的研究
计算与语言
2023-02-14 v1 人工智能
机器学习
摘要
Transformer 架构由自注意力和前馈网络(FFN)组成,根据先前的工作,它们可被视为键值记忆。然而,FFN 和传统记忆使用不同的激活函数(即分别为 ReLU 和 Softmax),这使得它们并不等价。在本文中,我们通过对 ReLU 和 Softmax 进行广泛研究,首先重建了 FFN 与键值记忆之间的联系,发现当在 Softmax 上添加一个额外的层归一化模块时二者等价。此外,当值槽数量较大时,ReLU 在 FFN 和键值记忆上均优于 Softmax。我们分析了原因,进而在自注意力网络上探索了 ReLU 的这一良好性质,其中原始 Softmax 激活在长输入序列上表现不佳。我们随后提出了一个名为 ReLUFormer 的全 ReLU 架构,在文档翻译等长序列任务上优于基线 Transformer。本文阐明了以下几点:1)Softmax 和 ReLU 对元素使用不同的归一化方法,导致结果的方差不同,且 ReLU 擅长处理大量键值槽;2)FFN 与键值记忆等价,因此 Transformer 可被视为一个记忆网络,其中 FFN 和自注意力网络均为键值记忆。
引用
@article{arxiv.2302.06461,
title = {A Study on ReLU and Softmax in Transformer},
author = {Kai Shen and Junliang Guo and Xu Tan and Siliang Tang and Rui Wang and Jiang Bian},
journal= {arXiv preprint arXiv:2302.06461},
year = {2023}
}
备注
work in progress