LEMoE:用于大型语言模型持续模型编辑的高级混合专家适配器
计算与语言
2024-07-01 v1
摘要
大型语言模型 (LLM) 需要持续的知识更新以跟上不断变化的世界事实,从而催生了持续模型编辑任务。尽管过去几年开发了各种针对单次和批量编辑的技术,但这些方法在面对持续编辑时要么无法应用,要么性能次优。本文引入 LEMoE,一个用于持续模型编辑的高级混合专家 (MoE) 适配器。我们首先分析影响常规 MoE 适配器在持续编辑中效果的因素,包括灾难性遗忘、不一致的路由和顺序敏感性。基于这些洞见,我们提出一种量身定制的模块插入方法,以实现持续编辑,同时引入新颖的 KV 锚定路由以增强训练和推理阶段之间的路由一致性,并采用简洁而有效的聚类方法进行编辑顺序规划。实验结果表明,我们的方法在持续编辑中有效,超越了以往的模型编辑技术,同时在批量编辑任务中保持出色的性能。我们的代码将公开提供。
引用
@article{arxiv.2406.20030,
title = {LEMoE: Advanced Mixture of Experts Adaptor for Lifelong Model Editing of Large Language Models},
author = {Renzhi Wang and Piji Li},
journal= {arXiv preprint arXiv:2406.20030},
year = {2024}
}