中文

单层 Softmax 注意力模型上梯度流的隐式正则化

机器学习 2024-03-14 v1 人工智能 最优化与控制 机器学习

摘要

我们研究了一个分类问题中单层 softmax 注意力模型在指数损失函数上的梯度流,其中键和查询权重矩阵分别训练。在数据的可分离性假设下,我们证明当梯度流达到最小损失值时,它进一步隐式地最小化了键和查询权重矩阵乘积的核范数。这种隐式正则化可以通过一个关于注意力权重的支持向量机(SVM)问题来描述。这一发现与先前的结果形成对比,先前结果表明当键和查询矩阵合并为单个权重矩阵进行训练时,梯度下降会诱导对乘积权重矩阵 Frobenius 范数的隐式正则化。对于对角键和查询矩阵,我们的分析建立在重参数化技术之上,并利用了与分类数据相关联的 SVM 的近似 KKT 条件。此外,在初始化时权重矩阵的奇异空间与数据特征适当对齐的条件下,结果可推广到一般的权重配置。

关键词

引用

@article{arxiv.2403.08699,
  title  = {Implicit Regularization of Gradient Flow on One-Layer Softmax Attention},
  author = {Heejune Sheen and Siyu Chen and Tianhao Wang and Harrison H. Zhou},
  journal= {arXiv preprint arXiv:2403.08699},
  year   = {2024}
}

备注

34 pages