自注意力机制中的归纳偏置与变量创建
机器学习
2022-06-27 v2 机器学习
摘要
自注意力是一种为建模序列数据中长程交互而设计的架构基元,已推动了自然语言处理及更广泛领域的众多近期突破。本工作对自注意力模块的归纳偏置进行了理论分析。我们的重点在于严格确立自注意力块偏好表示哪些函数与长程依赖。我们的主要结果表明,有界范数 Transformer 网络会“创建稀疏变量”:单个自注意力头可表示输入序列的稀疏函数,其样本复杂度仅随上下文长度对数缩放。为支持我们的分析,我们给出了合成实验以探查用 Transformer 学习稀疏布尔函数的样本复杂度。
引用
@article{arxiv.2110.10090,
title = {Inductive Biases and Variable Creation in Self-Attention Mechanisms},
author = {Benjamin L. Edelman and Surbhi Goel and Sham Kakade and Cyril Zhang},
journal= {arXiv preprint arXiv:2110.10090},
year = {2022}
}
备注
v2: camera-ready revisions for ICML 2022