注意力机制有多平滑?
机器学习
2024-06-05 v2
摘要
自注意力(self-attention)和掩码自注意力是 Transformer 取得卓越成功的核心。然而,我们对注意力机制的数学理解,特别是其 Lipschitz 性质(这在分析鲁棒性和表达能力时至关重要),尚不完整。本文详细研究了多种实际场景下自注意力的 Lipschitz 常数,探讨了序列长度 和层归一化对未掩码和掩码自注意力局部 Lipschitz 常数的影响。特别是,我们证明了对于任何紧集中的长度为 的输入,自注意力的 Lipschitz 常数以 为界(相差一个常数因子),且该界在合理的序列长度下是紧的。当序列长度 过大导致上述界限不再紧致时(我们称之为平均场机制),我们提供了一个与 无关的上界和匹配的下界。我们提出的针对掩码自注意力的平均场框架具有新颖性且具有独立意义。我们在预训练和随机初始化的 BERT 及 GPT-2 上进行的实验支持了我们的理论发现。
引用
@article{arxiv.2312.14820,
title = {How Smooth Is Attention?},
author = {Valérie Castin and Pierre Ablin and Gabriel Peyré},
journal= {arXiv preprint arXiv:2312.14820},
year = {2024}
}
备注
Accepted at ICML 2024