中文

序列多指标模型与深度注意力网络的学习基本极限:高维渐近与尖锐阈值

机器学习 2025-11-13 v1 无序系统与神经网络

摘要

本文研究深度注意力神经网络的学习,该网络定义为多个自注意力层的复合,且具有绑定和低秩权重。我们首先建立了此类模型到序列多指标模型的映射,后者是将广泛研究的多指标模型推广到序列协变量,并为此建立了一系列一般性结果。在贝叶斯最优学习背景下,在大维度 DD 和相称的大样本量 NN 的极限下,我们推导了最优性能以及该设置下最知名多项式时间算法——即近似消息传递——的性能的尖锐渐近特征,并刻画了优于随机预测性能所需的最小样本复杂度的尖锐阈值。我们的分析特别揭示了不同层是如何被顺序学习的。最后,我们讨论了这种顺序学习如何也能在现实设置中被观察到。

引用

@article{arxiv.2502.00901,
  title  = {Fundamental limits of learning in sequence multi-index models and deep attention networks: High-dimensional asymptotics and sharp thresholds},
  author = {Emanuele Troiani and Hugo Cui and Yatin Dandi and Florent Krzakala and Lenka Zdeborová},
  journal= {arXiv preprint arXiv:2502.00901},
  year   = {2025}
}