注意力已非你所必需:Transformer自注意力机制的可替代方案
机器学习
2023-09-20 v2 计算与语言
神经与进化计算
摘要
近年来,流行的Transformer架构在自然语言处理和计算机视觉等许多应用领域取得了巨大成功。许多现有工作旨在通过牺牲性能来降低Transformer中自注意力机制的计算和内存复杂度。然而,性能是Transformer持续成功的关键。本文提出了一类可即插即用地替换Transformer中自注意力机制的组件,称为Extractors(提取器)。作为示例,提出了四种类型的Extractors,即超高性能提取器(SHE)、较高性能提取器(HE)、值得提取器(WE)和极简提取器(ME)。实验结果表明,用SHE替换自注意力机制可显著提升Transformer的性能,而SHE的简化版本(即HE、WE和ME)在以更低的计算和内存复杂度运行的情况下,性能接近或优于自注意力机制。此外,由于所提Extractors的关键计算路径更短,它们有潜力或能够比自注意力机制运行得更快。另外,本文利用变长离散时间马尔可夫链对文本生成场景下的序列预测问题进行了形式化,并基于我们的理解对Transformer进行了回顾。
引用
@article{arxiv.2308.07661,
title = {Attention Is Not All You Need Anymore},
author = {Zhe Chen},
journal= {arXiv preprint arXiv:2308.07661},
year = {2023}
}