注意力层中的秩优势
机器学习
2024-07-24 v1 机器学习
摘要
注意力机制在机器学习中广泛应用,最突出的是在变压器中。然而,诸如注意力矩阵秩和注意力头数等超参数在所有此类架构的实现中几乎以相同方式进行比例缩放,缺乏理论依据。在本工作中,我们表明注意力头的秩与头数的之间存在显著的权衡。具体而言,我们提出了一个简单自然的目标函数,可使用单个全秩注意力头表示任意上下文长度,但除非注意力头数指数级地随嵌入维度增长,否则无法用低秩注意力近似,即使针对短上下文长度也是如此。此外,我们证明了对于短上下文长度,增加深度允许目标通过低秩注意力来近似。对于长上下文,我们推断全秩注意力是必要的。最后,我们针对即插即用变压器进行实验,验证了我们的理论发现。
引用
@article{arxiv.2407.16153,
title = {On the Benefits of Rank in Attention Layers},
author = {Noah Amsel and Gilad Yehudai and Joan Bruna},
journal= {arXiv preprint arXiv:2407.16153},
year = {2024}
}