注意力机制与理解 LoRA 的收敛随机训练
机器学习
2026-05-11 v1 泛函分析
概率论
摘要
Transformer 通过 revolutionized machine learning,注意力层的部署在越来越多的应用中都成为标准配置。此外,对于大型模型,常见做法是实现 Low Rank Adaptation (LoRA),即对其进行分解参数化训练,以实现意想不到的 accuracy-size trade-off。本文通过统一框架严格建立了此类模型在随机方法下的可训练性。我们证明,对于任何温和的正则化,注意力层和浅层神经网络上的 LoRA 上的经验回归损失都会导致相应 Gibbs 测度满足 Poincaré 不等式。随后通过引用最新结果,可以得出某种模仿 SGD 的 SDE 会最小化相应损失。在两种情况下,我们首次对注意力和网络的可训练性结果均不依赖于数据或架构大小的任何假设。
引用
@article{arxiv.2605.07959,
title = {Convergent Stochastic Training of Attention and Understanding LoRA},
author = {Zhengkai Sun and Dibyakanti Kumar and Alejandro F Frangi and Anirbit Mukherjee and Mingfei Sun},
journal= {arXiv preprint arXiv:2605.07959},
year = {2026}
}