中文

记忆精准局部化:面向大语言模型的细粒度神经元级知识编辑技术

计算与语言 2025-03-18 v2

摘要

知识编辑旨在更新大语言模型(LLM)中过时的知识。代表性研究方法是定位后编辑技术,通常利用因果追踪来识别负责召回实体相关事实知识的模块。然而,我们发现这些方法仅对主体实体的变化敏感,对关系变化的适应性较差。这一局限导致编辑局部性差,可能导致无关或不准确的事实残留,最终损害LLM的可靠性。我们认为,这一问题源于知识定位的精度不足。为此,我们提出了一种细粒度神经元级知识编辑(FiNE)方法,在不影响整体成功率的前提下显著提升编辑局部性。通过精确定位和修改前馈网络中的特定神经元,FiNE显著改善了知识的局部化及编辑。定量实验表明,FiNE在实现更佳整体性能方面效率更高,为理解和修改LLM内部知识提供了新的见解。

关键词

引用

@article{arxiv.2503.01090,
  title  = {Precise Localization of Memories: A Fine-grained Neuron-level Knowledge Editing Technique for LLMs},
  author = {Haowen Pan and Xiaozhi Wang and Yixin Cao and Zenglin Shi and Xun Yang and Juanzi Li and Meng Wang},
  journal= {arXiv preprint arXiv:2503.01090},
  year   = {2025}
}

备注

ICLR 2025