基于元学习的大语言模型大规模编辑
计算与语言
2024-01-26 v3 机器学习
摘要
尽管大语言模型(LLM)能够从预训练语料库中学习知识,但所获取的知识可能从根本上就是错误的或随时间推移而过时,这 necessitates 在训练后修正语言模型(LM)的知识。一种有前景的方法是使用超网络生成参数偏移,但现有的超网络在同步编辑操作数量上的可扩展性较差。为缓解这一问题,我们提出了大规模语言模型编辑网络(MAssive Language Model Editing Network, MALMEN),将参数偏移聚合表述为最小二乘问题,随后使用正规方程更新 LM 参数。为在有限的内存预算下同时编辑多个事实,我们将超网络和 LM 上的计算分离,从而允许这两个神经网络具有任意的批大小。我们的方法通过在不同架构的 LM(即 BERT-base、GPT-2、T5-XL (2.8B) 和 GPT-J (6B))上编辑多达数千个事实进行了评估,涵盖了各种知识密集型 NLP 任务,即闭卷事实核查和问答。值得注意的是,在相同的超网络架构下,MALMEN 能够编辑比强基线多数百倍的事实,并优于专为 GPT 设计的编辑器。我们的代码可在 https://github.com/ChenmienTan/malmen 获取。
引用
@article{arxiv.2311.04661,
title = {Massive Editing for Large Language Models via Meta Learning},
author = {Chenmien Tan and Ge Zhang and Jie Fu},
journal= {arXiv preprint arXiv:2311.04661},
year = {2024}
}