中文

定位与编辑GPT中的事实关联

计算与语言 2023-01-16 v5 机器学习

摘要

我们分析了自回归Transformer语言模型中事实关联的存储与召回,发现证据表明这些关联对应于局部的、可直接编辑的计算。我们首先开发了一种因果干预方法,用于识别在模型的事实预测中起决定性作用的神经元激活。这揭示了在处理主语词元时,中间层前馈模块中有一组独特的步骤在调节事实预测。为了验证这些计算对应于事实关联召回的假设,我们使用秩一模型编辑(ROME)修改前馈权重以更新特定的事实关联。我们发现,ROME在标准的零样本关系抽取(zsRE)模型编辑任务上效果显著,与现有方法相当。为了进行更敏感的评估,我们还在一个新的反事实断言数据集上评估了ROME,在该数据集上,ROME同时保持了特异性和泛化性,而其他方法则牺牲了其中一项。我们的工作证实了中间层前馈模块在存储事实关联中的重要作用,并表明直接操纵计算机制可能是模型编辑的一种可行方法。代码、数据集、可视化以及交互式演示笔记本可在 https://rome.baulab.info/ 获取。

关键词

引用

@article{arxiv.2202.05262,
  title  = {Locating and Editing Factual Associations in GPT},
  author = {Kevin Meng and David Bau and Alex Andonian and Yonatan Belinkov},
  journal= {arXiv preprint arXiv:2202.05262},
  year   = {2023}
}

备注

NeurIPS 2022. 35 pages, 30 figures. Code and data at https://rome.baulab.info/