微调后编辑知识的保持分析
计算与语言
2025-10-27 v2 人工智能
摘要
大型语言模型(LLM)存储了大量知识,这些知识通常需要更新以纠正事实错误、整合新获取的信息或调整模型行为。模型编辑方法已成为此类更新的高效解决方案,与持续训练相比,它们能以显著更低的计算成本提供局部且精确的知识修改。与此同时,LLM经常针对广泛的下游任务进行微调。然而,微调对先前编辑知识的影响仍知之甚少。在这项工作中,我们系统地研究了不同的微调目标如何与各种模型编辑技术相互作用。我们的研究结果表明,编辑后的知识在微调过程中比通过预训练获得的内在知识更容易被遗忘。该分析突显了当前编辑方法的一个关键局限性,并表明在下游微调下评估编辑鲁棒性对于其实际部署至关重要。我们进一步发现,通过在微调阶段用释义增强编辑知识或冻结与编辑内容相关的层,可以显著提高知识保持率,这为开发更鲁棒的编辑算法提供了见解。
引用
@article{arxiv.2507.14198,
title = {Retention analysis of edited knowledge after fine-tuning},
author = {Fufang Wen and Shichang Zhang},
journal= {arXiv preprint arXiv:2507.14198},
year = {2025}
}