中文

Sequence-Single Index 模型与单层注意力网络中 SGD 的渐近性

机器学习 2025-11-13 v1 无序系统与神经网络 机器学习

摘要

我们研究了一类序列模型(称为 Sequence Single-Index (SSI) 模型)的随机梯度下降(SGD)动力学,其中目标取决于应用于 token 序列的输入空间中的单一方向。该设置将经典的单索引模型推广到序列领域,涵盖了简化的单层注意力架构。我们推导出了以一对捕获语义和位置对齐的充分统计量表示的总体损失的闭式表达式,并刻画了这些坐标诱导的高维 SGD 动力学。我们的分析揭示了两个不同的训练阶段:从无信息初始化中逃逸并与目标子空间对齐,并展示了序列长度和位置编码如何影响收敛速度和学习轨迹。这些结果为理解数据中的序列结构如何有利于基于注意力模型的学习提供了严格且可解释的基础。

关键词

引用

@article{arxiv.2506.02651,
  title  = {Asymptotics of SGD in Sequence-Single Index Models and Single-Layer Attention Networks},
  author = {Luca Arnaboldi and Bruno Loureiro and Ludovic Stephan and Florent Krzakala and Lenka Zdeborova},
  journal= {arXiv preprint arXiv:2506.02651},
  year   = {2025}
}