中文

无注意力预训练

计算与语言 2023-05-10 v2 机器学习

摘要

Transformer 对 NLP 中的预训练成功至关重要。尽管也使用了其他架构,但下游准确率要么显著变差,要么需要注意力层才能匹配 GLUE 等标准基准。本工作通过使用基于状态空间模型(SSMs)的序列路由的最新进展,探索无注意力预训练。我们提出的模型,双向门控 SSM(BiGS),将 SSM 层与在简化序列建模架构中有效的乘性门控架构相结合。该模型学习不考虑成对交互的静态层。即便如此,BiGS 能够在 GLUE 上匹配 BERT 预训练准确率,并且可以无需近似扩展到 4096 个 token 的长文本预训练。分析表明,尽管模型具有相似的平均准确率,但该方法在交互和句法表示方面具有与 BERT 不同的归纳偏置。本工作的所有模型可在 https://github.com/jxiw/BiGS 获取。

关键词

引用

@article{arxiv.2212.10544,
  title  = {Pretraining Without Attention},
  author = {Junxiong Wang and Jing Nathan Yan and Albert Gu and Alexander M. Rush},
  journal= {arXiv preprint arXiv:2212.10544},
  year   = {2023}
}