中文

注意力近似于稀疏分布式记忆

机器学习 2022-01-19 v2 人工智能

摘要

尽管注意力已成为深度学习中重要的机制,但对于其为何如此有效仍缺乏直观理解。在此,我们表明在特定数据条件下 Transformer 注意力可与 Kanerva 的稀疏分布式记忆(SDM)——一种生物学上合理的联想记忆模型——紧密关联。我们确认这些条件在预训练的 GPT2 Transformer 模型中得到满足。我们讨论了注意力-SDM 映射的启示,并提供了注意力的新计算与生物学解释。

关键词

引用

@article{arxiv.2111.05498,
  title  = {Attention Approximates Sparse Distributed Memory},
  author = {Trenton Bricken and Cengiz Pehlevan},
  journal= {arXiv preprint arXiv:2111.05498},
  year   = {2022}
}