注意力近似于稀疏分布式记忆
机器学习
2022-01-19 v2 人工智能
摘要
尽管注意力已成为深度学习中重要的机制,但对于其为何如此有效仍缺乏直观理解。在此,我们表明在特定数据条件下 Transformer 注意力可与 Kanerva 的稀疏分布式记忆(SDM)——一种生物学上合理的联想记忆模型——紧密关联。我们确认这些条件在预训练的 GPT2 Transformer 模型中得到满足。我们讨论了注意力-SDM 映射的启示,并提供了注意力的新计算与生物学解释。
引用
@article{arxiv.2111.05498,
title = {Attention Approximates Sparse Distributed Memory},
author = {Trenton Bricken and Cengiz Pehlevan},
journal= {arXiv preprint arXiv:2111.05498},
year = {2022}
}