ELDER:基于混合 LoRA 的提升终身模型编辑
计算与语言
2025-01-15 v3 人工智能
机器学习
摘要
大型语言模型(LLM)需要进行模型编辑,以有效更新其中的特定知识并避免事实错误。大多数模型编辑方法仅设计用于单次使用,在终身编辑场景下会导致显著的遗忘效应,即随着时间的推移进行顺序编辑。以往的方法通过冻结原始参数并为每个知识更新离散分配新参数来管理顺序编辑。然而,这些方法由于数据与参数之间的离散映射,缺乏对小输入变异的鲁棒性。为克服这一挑战,我们提出了 ELDER,一种创建数据与适配器之间连续关联的新方法。ELDER 通过路由网络整合多个 LoRAs,并训练以建立平滑的数据-适配器关联,从而增强对语义等效输入的编辑鲁棒性和泛化能力。为确保包含相同知识的输入将由相同的 LoRAs 处理,我们设计了一种新型损失函数,以引导模型将 LoRA 分配与编辑知识关联。此外,我们提出了一种延迟机制,以保留编辑后 LLM 的原始能力。在 GPT-2 XL 和 LLaMA2-7B 上的大量实验表明,ELDER 在终身设置下有效地编辑了模型,超过了八个基线模型,同时展现出强大的可扩展性并在下游任务上保留了 LLM 的通用能力。我们的代码可在 https://github.com/JiaangL/ELDER 获取。
引用
@article{arxiv.2408.11869,
title = {ELDER: Enhancing Lifelong Model Editing with Mixture-of-LoRA},
author = {Jiaang Li and Quan Wang and Zhongnan Wang and Yongdong Zhang and Zhendong Mao},
journal= {arXiv preprint arXiv:2408.11869},
year = {2025}
}
备注
Accepted by AAAI-25