可证明地学习多头注意力层
机器学习
2024-02-07 v1 数据结构与算法
机器学习
摘要
多头注意力层是 Transformer 架构的关键组件之一,使其有别于传统的前馈模型。给定序列长度 、注意力矩阵 和投影矩阵 ,相应的多头注意力层 通过 对 维 token 的长度为 的序列 进行变换。在本工作中,我们开创性地从随机样本中可证明地学习多头注意力层,并给出了该问题的首个非平凡上下界:\n- 在 满足某些非退化条件的前提下,我们提出了一种时间复杂度为 的算法,该算法在给定从 均匀抽取的随机标注样本时,能以极小误差学习 。\n- 我们证明了计算下界,表明在最坏情况下,对 的指数依赖是不可避免的。我们聚焦于布尔型 以模拟大型语言模型中 token 的离散性质,尽管我们的技术自然地扩展到标准的连续设置(如高斯分布)。我们的算法以利用样本雕刻出包含未知参数的凸体为核心,这与现有的可证明的前馈网络学习算法有显著不同,后者主要利用高斯分布的代数和旋转不变性。相比之下,我们的分析更加灵活,因为它主要依赖于输入分布及其“切片”的各种上下尾界。
关键词
引用
@article{arxiv.2402.04084,
title = {Provably learning a multi-head attention layer},
author = {Sitan Chen and Yuanzhi Li},
journal= {arXiv preprint arXiv:2402.04084},
year = {2024}
}
备注
105 pages, comments welcome