中文

黄金层数与寻找之路:通过层梯度分析改进大语言模型知识编辑

机器学习 2026-05-18 v3 人工智能

摘要

大语言模型(LLM)知识编辑旨在更新模型对特定查询的预测结果,以满足期望的目标,同时保留其在其他输入上的行为。该过程通常包含两个阶段:识别编辑层次及执行参数更新。直观上,不同查询可能在模型不同深度处局部化知识,导致固定编辑层次下的样本级编辑性能差异。在本工作中,我们假设存在固定的黄金层,可实现接近样本级最优层次的编辑性能。为验证假设,我们通过将黄金层与真实样本级最优层进行比较,提供了实证证据。此外,我们表明黄金层可通过代理数据集可靠识别,并在跨数据集的未见测试查询上有效泛化。最后,我们提出一种新方法,即层梯度分析(LGA),通过梯度归因高效估算黄金层,避免多次编辑运行中的试错。多个基准数据集上的广泛实验表明,我们的LGA方法在不同LLM类型及各种知识编辑方法下均有效且稳健。

关键词

引用

@article{arxiv.2602.20207,
  title  = {Golden Layers and Where to Find Them: Improved Knowledge Editing for Large Language Models Via Layer Gradient Analysis},
  author = {Shrestha Datta and Hongfu Liu and Anshuman Chhabra},
  journal= {arXiv preprint arXiv:2602.20207},
  year   = {2026}
}