自注意力机制是否需要独立的权重?
计算与语言
2025-05-05 v2
摘要
自注意力的成功在于其捕获长程依赖并增强上下文理解的能力,但其计算复杂度限制了其处理具有内在方向性的序列数据的能力。本工作引入了基于共享权重的自注意力BERT模型,该模型仅学习Key、Value和Query表示的一个权重矩阵,而不是三个独立矩阵。我们的共享注意力机制将训练参数规模缩小一半以上,训练时间缩短约为五分之一。此外,我们在GLUE数据集上的小型任务中证明了该模型在准确率上优于BERT基线,特别是在噪声和超出域数据上的泛化能力更佳。实验结果表明,共享自注意力方法在注意力块中的参数规模降低了66.53%。在GLUE数据集上,基于共享权重自注意力的BERT模型在标准、对称和成对注意力基于BERT的模型中的准确率分别提高了0.38%、5.81%和1.06%。该模型和源代码均可在Anonymous处获取。
引用
@article{arxiv.2412.00359,
title = {Does Self-Attention Need Separate Weights in Transformers?},
author = {Md Kowsher and Nusrat Jahan Prottasha and Chun-Nam Yu and Ozlem Ozmen Garibay and Niloofar Yousefi},
journal= {arXiv preprint arXiv:2412.00359},
year = {2025}
}
备注
Preprint paper