中文

模型编辑后性能下降的原因与解决方案

计算与语言 2024-11-01 v1 人工智能

摘要

知识编辑技术因能够低成本更新大规模语言模型中的错误或过时知识而受到广泛关注。然而,近期研究发现编辑后的模型往往表现出不同程度的性能下降。这一现象背后的原因及潜在解决方案尚未被揭示。为了研究编辑模型性能下降的原因并优化编辑方法,本工作从数据和模型两个角度探讨了潜在原因。具体而言,1) 从数据角度,为明确编辑数据对编辑模型性能的影响,本文首先构建了多问题数据集(MQD)以评估不同类型编辑数据对模型性能的影响。实验表明,编辑模型的性能主要受编辑目标多样性和序列长度的影响。2) 从模型角度,本文探讨了影响编辑模型性能的因素。结果表明编辑模型层的L1范数与编辑准确率之间存在强相关性,并阐明这是导致编辑性能瓶颈的重要因素。最后,为提升编辑模型的性能,本文进一步提出了基于序列的转储(D4S)方法,通过降低编辑层的L1范数成功克服了先前的编辑瓶颈,使用户能够执行多次有效编辑并最小化模型损伤。我们的代码可在 https://github.com/nlpkeg/D4S 获取。

关键词

引用

@article{arxiv.2410.23844,
  title  = {Commonsense Knowledge Editing Based on Free-Text in LLMs},
  author = {Xiusheng Huang and Yequan Wang and Jun Zhao and Kang Liu},
  journal= {arXiv preprint arXiv:2410.23844},
  year   = {2024}
}

备注

11 pages, 8 figures