中文

单层注意力可学习什么?基于随机特征视角的研究

机器学习 2023-07-24 v1 统计理论 机器学习 统计理论

摘要

注意力层——将输入序列映射为输出序列——是 Transformer 架构的核心构建模块,该架构已在现代人工智能中取得重大突破。本文对具有键向量序列与独立查询向量的单层多头注意力层的学习与泛化进行严格理论研究。我们考虑随机特征设定,其中注意力层具有大量头,查询与键矩阵随机采样冻结,值矩阵可训练。我们表明此类随机特征注意力层可表达一类对键向量置换不变的广泛目标函数。我们进一步提供使用有限头随机特征注意力从有限样本学习这些目标函数的定量超额风险界。与现有神经网络随机特征理论相比,我们的结果具有若干注意力结构独有的含义,例如(1)相较标准两层随机特征网络在样本复杂度上的优势;(2)可被随机特征注意力层高效学习的具象且自然的函数类;以及(3)查询-键权重矩阵(查询与键矩阵之积)采样分布的影响,其中具有非零均值的高斯随机权重在学习某些自然目标函数时比零均值对应物具有更优样本复杂度。模拟数据上的实验佐证了我们的理论发现,并进一步阐释了样本规模与目标函数复杂度之间的相互作用。

关键词

引用

@article{arxiv.2307.11353,
  title  = {What can a Single Attention Layer Learn? A Study Through the Random Features Lens},
  author = {Hengyu Fu and Tianyu Guo and Yu Bai and Song Mei},
  journal= {arXiv preprint arXiv:2307.11353},
  year   = {2023}
}

备注

41pages, 5 figures