中文

通过定制专家网络实现可扩展模型编辑

计算与语言 2024-08-09 v2

摘要

大语言模型中的幻觉与过时知识问题亟需解决,以确保其可靠应用。模型编辑是一种具有成本效益的解决方案。然而,现有方法常表现出较差的泛化性及对非编辑样本的意外影响。为克服这些限制,我们提出一种新方法:定制专家网络实现的可扩展模型编辑 (Scalable Model Editing via Customized Expert Networks, SCEN)。该方法为两个阶段的连续训练范式。具体而言,在第一个阶段,我们为需要更新的每项知识单独训练轻量级专家网络。随后,为每个专家训练相应的索引神经元,以控制该专家的激活状态。我们在 ZsRE 和幻觉基准测试上进行实验,采用调参的开源 LLM Llama2,实现了相较于当前主流方法的领先成绩。我们的代码已公开于 https://github.com/TAL-auroraX/SCEN。

关键词

引用

@article{arxiv.2404.02699,
  title  = {Scalable Model Editing via Customized Expert Networks},
  author = {Zihan Yao and Yu He and Tianyu Qi and Ming Li},
  journal= {arXiv preprint arXiv:2404.02699},
  year   = {2024}
}

备注

Accepted by COLM2024