紧凑型大语言模型中的手术知识重写:基于($IA^3$)的“非学习后再学习”策略用于局部事实调制与灾难性遗忘缓解
机器学习
2025-08-12 v1 人工智能
摘要
大型语言模型(LLMs)在动态知识更新方面存在困难,尤其是当新信息与深度嵌入的事实发生冲突时。此类冲突性事实编辑常常导致两个关键问题:对新事实的采纳 resistance 以及对无关知识的严重灾难性遗忘。本文引入并评估了一种 novel“非学习后再学习”策略,用于LLMs中的精确知识编辑,利用参数高效微调(PEFT)技术,Infused Adapter by Inhibiting and Amplifying Inner Activations()。关键在于,该两阶段方法得益于初始的电路局化阶段,以识别和针对编码冲突事实的特定内部组件。通过对microsoft/Phi-3-mini-4k-instruct进行严格的实验方法,我们展示,该以机制为导向的两阶段方法实现了对新调制事实的近乎完美准确率(98.50%),同时有效抑制原有冲突事实(96.00%遗忘率)。 critically地,该策略在局部化(72.00%F_control准确率)方面实现了前所未有的水平,显著缓解了直接微调方法中观察到的灾难性遗忘(其准确率甚至低于约20%F_control准确率),这直接归功于我们精准的可解释性引导干预。此外,定性分析揭示了一种“软遗忘”机制,即原有知识从默认检索中被抑制,但保持潜在且在特定条件下可被访问,从而增强了模型的安全性和可控性。这些发现代表了对紧凑型LLMs进行精确、局部化和安全知识管理的重大进展。
引用
@article{arxiv.2508.07075,
title = {Surgical Knowledge Rewrite in Compact LLMs: An 'Unlearn-then-Learn' Strategy with ($IA^3$) for Localized Factual Modulation and Catastrophic Forgetting Mitigation},
author = {Stanley Ngugi},
journal= {arXiv preprint arXiv:2508.07075},
year = {2025}
}
备注
9 pages, 2 visual aids