中文

通过习语理解 Transformer 的记忆召回机制

计算与语言 2023-02-14 v3

摘要

为了产生准确的预测,语言模型(LMs)必须在泛化与记忆化之间取得平衡。然而,关于 transformer LMs 利用其记忆容量的机制知之甚少。模型何时决定输出记忆化短语,该短语又如何从记忆中被检索?在这项工作中,我们提出了首个用于探测和刻画 transformer LMs 中记忆序列召回的方法论框架。首先,我们阐明了检测触发记忆召回的模型输入的标准,并提出以习语作为通常满足这些标准的输入。接下来,我们构建了一个英语习语数据集,并用它来比较模型在记忆化与非记忆化输入上的行为。具体而言,我们通过将模型的隐藏表示解释为输出概率分布的逐步精炼,来分析内部预测构建过程。我们发现,在不同模型规模与架构下,记忆化预测是一个两步过程:早期层将预测词元提升到输出分布的顶部,上层则提高模型置信度。这表明记忆信息存储并检索于网络的早期层。最后,我们在记忆化事实性陈述中展示了我们的方法超越习语的效用。总体而言,我们的工作朝着理解记忆召回迈出了第一步,并为未来 transformer 记忆化的研究提供了方法论基础。

关键词

引用

@article{arxiv.2210.03588,
  title  = {Understanding Transformer Memorization Recall Through Idioms},
  author = {Adi Haviv and Ido Cohen and Jacob Gidron and Roei Schuster and Yoav Goldberg and Mor Geva},
  journal= {arXiv preprint arXiv:2210.03588},
  year   = {2023}
}