模型编辑损害大型语言模型的一般能力:正则化来补救
计算与语言
2024-10-08 v4
摘要
模型编辑是一种通过更新知识来编辑大型语言模型(LLMs)以减轻幻觉,而无需进行资源密集型重新训练的技术。虽然当前的模型编辑方法可以有效地修改模型在特定兴趣领域内的行为,但它们往往忽视了可能对LLMs的一般能力(如推理、自然语言推理和问答)产生的潜在非预期副作用。在本文中,我们提出担忧,即模型编辑在事实性方面的改进可能以模型一般能力的显著退化为代价。我们通过在三个LLMs上跨八个代表性任务评估四种流行的编辑方法,系统地分析了这些副作用。我们广泛的实证实验表明,当前的编辑方法难以同时提高LLMs的事实性并保持其一般能力。我们的分析揭示,副作用是由于模型编辑过度改变了原始模型权重,导致对编辑事实的过拟合。为了缓解这一问题,我们提出了一种名为RECT的方法,该方法通过基于权重的相对变化(RElative Change in weighT)对编辑更新权重施加复杂度约束来进行正则化。评估结果表明,RECT能够显著减轻编辑的副作用,同时仍保持超过94%的编辑性能。
引用
@article{arxiv.2401.04700,
title = {Model Editing Harms General Abilities of Large Language Models: Regularization to the Rescue},
author = {Jia-Chen Gu and Hao-Xiang Xu and Jun-Yu Ma and Pan Lu and Zhen-Hua Ling and Kai-Wei Chang and Nanyun Peng},
journal= {arXiv preprint arXiv:2401.04700},
year = {2024}
}
备注
Accepted by EMNLP 2024