我们真的应该编辑语言模型吗?关于被编辑语言模型的评估
人工智能
2024-10-25 v1
摘要
模型编辑日益成为语言模型内部知识高效更新的热门方法。当前方法主要聚焦可靠性、泛化性和局部性,许多方法在这些标准上表现优异。近期一些研究揭示了这些编辑方法的诸多缺陷,如知识失真或冲突。然而,编辑后语言模型的通用能力仍未得到探索。本文对各种编辑方法和不同语言模型进行全面评估,得出以下结论。(1)现有编辑方法会导致在通用基准测试上的不可避免性能下降,表明现有编辑方法仅能在模型的通用能力维持于仅几十次编辑之内。当编辑次数稍大时,模型内在的知识结构会被破坏甚至完全损坏。(2)指令微调模型对编辑更具鲁棒性,在进行编辑后表现出更少的通用知识性能下降。(3)规模更大的语言模型对编辑更抗性,表现出更好的抵抗能力。(4)经编辑的模型安全性显著下降,即便是那些经过安全对齐的模型也是如此。我们的发现表明,当前的编辑方法仅适用于语言模型中小规模的知识更新,这进一步激发了对更实用可靠的编辑方法的研究需求。代码和复现细节可在 https://github.com/lqinfdim/EditingEvaluation 查看。
引用
@article{arxiv.2410.18785,
title = {Should We Really Edit Language Models? On the Evaluation of Edited Language Models},
author = {Qi Li and Xiang Liu and Zhenheng Tang and Peijie Dong and Zeyu Li and Xinglin Pan and Xiaowen Chu},
journal= {arXiv preprint arXiv:2410.18785},
year = {2024}
}
备注
NeurIPS 2024 https://github.com/lqinfdim/EditingEvaluation