中文

定位是否有助于编辑?基于因果的定位与语言模型中知识编辑的惊人差异

机器学习 2023-10-17 v2 人工智能 计算与语言

摘要

语言模型在预训练期间学习了大量事实信息,近期工作将这些信息定位到特定的模型权重(如中层MLP权重)。在本文中,我们发现可以通过编辑位于现有方法所指示的事实存储位置之外的权重,来改变模型中事实的存储方式。这令人惊讶,因为我们会预期将事实定位到特定模型参数能告诉我们应在何处操纵模型中的知识,且该假设已推动了以往关于模型编辑方法的工作。具体而言,我们表明来自表示去噪(亦称Causal Tracing)的定位结论,并未就为用新事实覆盖已有存储事实而应最佳编辑哪个模型MLP层提供任何洞见。该发现对以往工作如何依赖Causal Tracing来选择编辑哪些模型层提出了疑问。接下来,我们考虑了编辑问题的若干变体,包括擦除与放大事实。对于我们的一个编辑问题,编辑性能确实与来自表示去噪的定位结果相关,但我们发现所编辑的层是性能的远更佳预测因子。我们的结果反直觉地表明,对预训练语言模型如何运作更好的机制性理解,未必总能转化为关于如何最佳改变其行为方式的洞见。我们的代码见 https://github.com/google/belief-localization

关键词

引用

@article{arxiv.2301.04213,
  title  = {Does Localization Inform Editing? Surprising Differences in Causality-Based Localization vs. Knowledge Editing in Language Models},
  author = {Peter Hase and Mohit Bansal and Been Kim and Asma Ghandeharioun},
  journal= {arXiv preprint arXiv:2301.04213},
  year   = {2023}
}

备注

NeurIPS 2023 (Spotlight). 26 pages, 22 figures