哪种 Transformer 架构适合我的数据?自注意力中的词表瓶颈
机器学习
2021-06-10 v2 计算与语言
摘要
Transformer 架构在自然语言处理中成功亮相后,现正成为许多领域的事实标准。其在新模态上部署的一个障碍是架构配置:最优深宽比已被证明在不同数据类型间差异巨大(例如,在图像上比在语言上大 倍)。我们从理论预测了限制自注意力宽度对 Transformer 表达能力贡献的嵌入秩瓶颈的存在。因此,我们将输入词表大小与秩直接联系到最优深宽比,因为较小的词表大小或秩决定了深度相对于宽度的额外优势。我们通过实验证明了该瓶颈的存在及其对 Transformer 架构深宽权衡的影响,将跨领域的架构可变性联系到不同领域中常被忽视的所用词表大小或嵌入秩的差异。作为额外益处,我们的秩瓶颈框架使我们能识别诸如 ALBERT 和 T5 等领先 NLP 模型中 的规模冗余。
引用
@article{arxiv.2105.03928,
title = {Which transformer architecture fits my data? A vocabulary bottleneck in self-attention},
author = {Noam Wies and Yoav Levine and Daniel Jannai and Amnon Shashua},
journal= {arXiv preprint arXiv:2105.03928},
year = {2021}
}
备注
ICML 2021