中文

从自注意力到马尔可夫模型:揭示生成式 Transformer 的动力学

机器学习 2024-02-22 v1 人工智能 计算与语言

摘要

现代语言模型依赖于 Transformer 架构和注意力机制来执行语言理解和文本生成。在本工作中,我们研究了从一组提示及其关联输出数据(由模型采样)中学习单层自注意力模型。我们首先在自注意力机制与马尔可夫模型之间建立了精确的映射:将提示输入到模型中可根据上下文条件马尔可夫链(CCMC)对输出 token 进行采样,该链为基本马尔可夫链的转移矩阵赋予权重。此外, incorporating 位置编码会导致转移概率的位置依赖缩放。基于此形式化框架,我们发展了针对提示分布的可识别性/覆盖条件,以保证一致估计,并在 IID 样本下建立了样本复杂度保证。最后,我们研究了从单个由初始提示生成的输出轨迹中学习的问题。我们描述了一种引人注目的 winner-takes-all 现象,即由自注意力实现的生成过程因其非混合性质而退化为仅采样有限子集 token。这提供了对现代大语言模型生成重复文本倾向的数学解释。总之,CCMC 的等价性提供了一个简单而强大的框架来研究自注意力及其属性。

关键词

引用

@article{arxiv.2402.13512,
  title  = {From Self-Attention to Markov Models: Unveiling the Dynamics of Generative Transformers},
  author = {M. Emrullah Ildiz and Yixiao Huang and Yingcong Li and Ankit Singh Rawat and Samet Oymak},
  journal= {arXiv preprint arXiv:2402.13512},
  year   = {2024}
}

备注

30 pages