中文

揭示大型语言模型编辑中的过拟合现象

计算与语言 2025-06-18 v2

摘要

知识编辑被提出作为更新和纠正大型语言模型 (LLM) 内部知识的有效方法。然而,现有的编辑方法在处理复杂任务(如多跳推理)时常常遇到困难。本文我们识别并研究了编辑过拟合 (Editing Overfit) 的现象,即被编辑后的模型在编辑目标上分配出不成比例的高概率,从而阻碍了在复杂情境中对新知识的泛化。我们将此问题归因于当前编辑范式对每个编辑样本输入提示与编辑目标之间的直接对应关系过度强调。为进一步探讨此问题,我们引入了一个新的基准测试,EVOKE (EValuation of Editing Overfit in Knowledge Editing),以及细粒度评估指标。通过全面实验和分析,我们证明了编辑过拟合在当前编辑方法中很常见,常用的过拟合缓解策略在知识编辑中无效。为克服此问题,灵感来自 LLM 的知识召回机制,我们提出了一种新的即插即用策略,称为Learn the Inference (LTI),该策略引入了多阶段推理约束模块,以引导被编辑后的模型像未被编辑的 LLM 那样通过基于情境学习来召回新知识。广泛的实验结果在各种任务上都验证了 LTI 在缓解编辑过拟合方面的有效性。

关键词

引用

@article{arxiv.2410.07819,
  title  = {Uncovering Overfitting in Large Language Model Editing},
  author = {Mengqi Zhang and Xiaotian Ye and Qiang Liu and Pengjie Ren and Shu Wu and Zhumin Chen},
  journal= {arXiv preprint arXiv:2410.07819},
  year   = {2025}
}

备注

ICLR 2025