注意力索引模型的贝叶斯最优学习
机器学习
2026-02-03 v3 无序系统与神经网络
信息论
math.IT
机器学习
摘要
我们引入了注意力索引模型(AIM),一个用于分析深度注意力层学习的理论框架。受多索引模型启发,AIM刻画了token级别的输出如何从高维嵌入上的分层双线性交互中产生。与先前易于处理的注意力模型不同,AIM允许全宽度的键和查询矩阵,从而更贴近实际的transformer。利用统计力学和随机矩阵理论的工具,我们推导出了贝叶斯最优泛化误差的闭式预测,并识别出作为样本复杂度、模型宽度和序列长度函数的尖锐相变。我们提出了一种匹配的近似消息传递算法,并表明梯度下降可以达到最优性能。AIM为理解现代架构关键组件——自注意力层中的学习提供了一个可解的试验场。
引用
@article{arxiv.2506.01582,
title = {Bayes optimal learning of attention-indexed models},
author = {Fabrizio Boncoraglio and Emanuele Troiani and Vittorio Erba and Lenka Zdeborová},
journal= {arXiv preprint arXiv:2506.01582},
year = {2026}
}