序列多指标模型与深度注意力网络的学习基本极限:高维渐近与尖锐阈值
机器学习
2025-11-13 v1 无序系统与神经网络
摘要
本文研究深度注意力神经网络的学习,该网络定义为多个自注意力层的复合,且具有绑定和低秩权重。我们首先建立了此类模型到序列多指标模型的映射,后者是将广泛研究的多指标模型推广到序列协变量,并为此建立了一系列一般性结果。在贝叶斯最优学习背景下,在大维度 和相称的大样本量 的极限下,我们推导了最优性能以及该设置下最知名多项式时间算法——即近似消息传递——的性能的尖锐渐近特征,并刻画了优于随机预测性能所需的最小样本复杂度的尖锐阈值。我们的分析特别揭示了不同层是如何被顺序学习的。最后,我们讨论了这种顺序学习如何也能在现实设置中被观察到。
引用
@article{arxiv.2502.00901,
title = {Fundamental limits of learning in sequence multi-index models and deep attention networks: High-dimensional asymptotics and sharp thresholds},
author = {Emanuele Troiani and Hugo Cui and Yatin Dandi and Florent Krzakala and Lenka Zdeborová},
journal= {arXiv preprint arXiv:2502.00901},
year = {2025}
}