通过习语理解 Transformer 的记忆召回机制
计算与语言
2023-02-14 v3
摘要
为了产生准确的预测,语言模型(LMs)必须在泛化与记忆化之间取得平衡。然而,关于 transformer LMs 利用其记忆容量的机制知之甚少。模型何时决定输出记忆化短语,该短语又如何从记忆中被检索?在这项工作中,我们提出了首个用于探测和刻画 transformer LMs 中记忆序列召回的方法论框架。首先,我们阐明了检测触发记忆召回的模型输入的标准,并提出以习语作为通常满足这些标准的输入。接下来,我们构建了一个英语习语数据集,并用它来比较模型在记忆化与非记忆化输入上的行为。具体而言,我们通过将模型的隐藏表示解释为输出概率分布的逐步精炼,来分析内部预测构建过程。我们发现,在不同模型规模与架构下,记忆化预测是一个两步过程:早期层将预测词元提升到输出分布的顶部,上层则提高模型置信度。这表明记忆信息存储并检索于网络的早期层。最后,我们在记忆化事实性陈述中展示了我们的方法超越习语的效用。总体而言,我们的工作朝着理解记忆召回迈出了第一步,并为未来 transformer 记忆化的研究提供了方法论基础。
引用
@article{arxiv.2210.03588,
title = {Understanding Transformer Memorization Recall Through Idioms},
author = {Adi Haviv and Ido Cohen and Jacob Gidron and Roei Schuster and Yoav Goldberg and Mor Geva},
journal= {arXiv preprint arXiv:2210.03588},
year = {2023}
}