中文

通过交换性与潜变量模型视角对注意力机制的分析

机器学习 2024-04-02 v3

摘要

借助注意力机制,transformer 取得了显著的实证成功。尽管直观上理解 transformer 通过对长序列进行关系推断以产生理想表示,我们仍缺乏关于注意力机制如何实现这一点的严格理论。特别地,若干引人深思的问题尚待解决:(a) 何为理想表示?(b) 注意力机制如何在前向传播中推断出理想表示?(c) 预训练过程如何通过反向传播学习推断理想表示?我们观察到,正如 BERT 与 ViT 中的情况,输入 token 通常是可交换的,因为它们已包含位置编码。可交换性这一概念引出了一个对输入大小不变的潜变量模型,从而使得我们的理论分析成为可能。- 为回答(a)关于表示,我们确立了输入 token 的充分且极小表示的存在性。特别地,此类表示实例化了给定输入 token 时潜变量的后验分布,其在预测输出标签与解决下游任务中扮演核心角色。- 为回答(b)关于推断,我们证明具有所需参数的注意力以直至近似误差的精度推断潜变量后验,该误差随输入大小递减。具体而言,我们量化了注意力如何近似给定键的值的条件均值,这刻画了它如何对长序列执行关系推断。- 为回答(c)关于学习,我们证明有监督与自监督目标均允许经验风险最小化以直至泛化误差的精度学习所需参数,该误差与输入大小无关。特别地,在自监督设定中,我们识别出一个对解决下游任务起关键作用的条件数。

关键词

引用

@article{arxiv.2212.14852,
  title  = {An Analysis of Attention via the Lens of Exchangeability and Latent Variable Models},
  author = {Yufeng Zhang and Boyi Liu and Qi Cai and Lingxiao Wang and Zhaoran Wang},
  journal= {arXiv preprint arXiv:2212.14852},
  year   = {2024}
}

备注

85 pages, 7 figures, add acknowledgement