中文

自注意力模型中的动态不稳定性

机器学习 2024-10-10 v1 偏微分方程分析 动力系统

摘要

我们考虑自注意力模型——一种在单位球面上进行的相互作用粒子系统,作为 transformer 这一深度神经网络架构的仿真模型,用以解释大型语言模型的最新成功。我们证明了在 [GLPR23] 中 conjectures 的动态不稳定性——尽管粒子以无限时间尺度向单个簇集中,但它们在指数级时间尺度上仍被困在数个簇的配置附近。通过利用梯度流解释,我们还将结果与奥托-雷斯尼科夫特 (Otto-Reznikoff) [OR07] 提出的框架联系起来,该框架在粗化和阿伦-钱方程的背景下研究慢运动。我们最终探讨了指数级不稳定性时期之后的动力学,说明在合适的时间尺度变换下,能量在有限时间内达到全局最大值并呈梯阶曲线,轨迹表现出类似 saddle-to-saddle 行为,这类似于最近用于分析通过梯度下降训练两层神经网络动力学的工作。

关键词

引用

@article{arxiv.2410.06833,
  title  = {Dynamic metastability in the self-attention model},
  author = {Borjan Geshkovski and Hugo Koubbi and Yury Polyanskiy and Philippe Rigollet},
  journal= {arXiv preprint arXiv:2410.06833},
  year   = {2024}
}