记忆精准局部化:面向大语言模型的细粒度神经元级知识编辑技术
计算与语言
2025-03-18 v2
摘要
知识编辑旨在更新大语言模型(LLM)中过时的知识。代表性研究方法是定位后编辑技术,通常利用因果追踪来识别负责召回实体相关事实知识的模块。然而,我们发现这些方法仅对主体实体的变化敏感,对关系变化的适应性较差。这一局限导致编辑局部性差,可能导致无关或不准确的事实残留,最终损害LLM的可靠性。我们认为,这一问题源于知识定位的精度不足。为此,我们提出了一种细粒度神经元级知识编辑(FiNE)方法,在不影响整体成功率的前提下显著提升编辑局部性。通过精确定位和修改前馈网络中的特定神经元,FiNE显著改善了知识的局部化及编辑。定量实验表明,FiNE在实现更佳整体性能方面效率更高,为理解和修改LLM内部知识提供了新的见解。
引用
@article{arxiv.2503.01090,
title = {Precise Localization of Memories: A Fine-grained Neuron-level Knowledge Editing Technique for LLMs},
author = {Haowen Pan and Xiaozhi Wang and Yixin Cao and Zenglin Shi and Xun Yang and Juanzi Li and Meng Wang},
journal= {arXiv preprint arXiv:2503.01090},
year = {2025}
}
备注
ICLR 2025