中文

权重衰减诱导低秩注意力层

机器学习 2024-11-01 v1

摘要

训练深度神经网络时,权重衰减等正则化项的作用尚不完全清楚。我们研究了在参数矩阵以乘法方式交互的神经网络模型中,权重衰减及 L2L2 正则化的影响。这种组合尤其值得关注,因为这种参数化在注意力层(Transformer 的主力)中很常见。在此,键-查询以及值-投影参数矩阵直接相乘:WKTWQW_K^TW_QPWVPW_V。我们扩展了先前的结果,一方面证明任何形式为 L(AB)+λ(A2+B2)L(AB^\top) + \lambda (\|A\|^2 + \|B\|^2)L2L2 正则化损失的局部极小值,都与核范数正则化损失 L(AB)+λABL(AB^\top) + \lambda\|AB^\top\|_* 的极小值重合;另一方面证明这两个损失在训练过程中会以指数速度变得相同。因此,我们补充了将 L2L2 正则化与低秩正则化联系起来的现有工作,并特别解释了为何对矩阵乘积施加此类正则化会影响训练的早期阶段。基于这些理论见解,我们通过实验验证:当使用权重衰减进行优化时(正如视觉任务和语言建模中通常所做的那样),注意力层内的键- 查询和值- 投影矩阵乘积 WKTWQ,PWVW_K^TW_Q, PW_V 确实会诱导 WKTWQW_K^TW_QPWVPW_V 的秩显著降低,即使在完全在线训练中也是如此。我们发现,与现有工作一致,在注意力矩阵乘积中诱导低秩可能会损害语言模型性能,并观察到将注意力层中的权重衰减与其余参数解耦的优势。

关键词

引用

@article{arxiv.2410.23819,
  title  = {Weight decay induces low-rank attention layers},
  author = {Seijin Kobayashi and Yassir Akram and Johannes Von Oswald},
  journal= {arXiv preprint arXiv:2410.23819},
  year   = {2024}
}