大规模模型编辑导致渐进性与灾难性遗忘
计算与语言
2024-06-11 v4 人工智能
信息检索
摘要
编辑大型语言模型中的知识是一项极具吸引力的能力,它使我们能够纠正预训练期间学习到的错误事实,并用不断增长的新事实列表更新模型。尽管现有的模型编辑技术已展现出潜力,但它们通常仅通过一次或少数几次编辑后的可靠性、特异性和泛化性指标进行评估。我们认为,要使模型编辑具有实际效用,必须能够对同一模型进行多次编辑。基于此,我们在大规模条件下评估了当前的模型编辑方法,重点关注两种最先进的方法:ROME和MEMIT。我们发现,当模型被多个事实顺序编辑时,它会持续遗忘先前编辑的事实以及执行下游任务的能力。这种遗忘分为两个阶段——首先是渐进但持续的遗忘阶段,随后是突然或灾难性的遗忘阶段。渐进性遗忘和灾难性遗忘都限制了模型编辑方法在大规模应用中的实用性——前者使得对模型进行多次编辑时效果降低,后者则限制了此类模型编辑方法的可扩展性上限。我们的分析还揭示了ROME和MEMIT在大规模条件下的其他关键局限性。通过这项工作,我们推动在考虑可扩展性的前提下开发和评估模型编辑方法。
引用
@article{arxiv.2401.07453,
title = {Model Editing at Scale leads to Gradual and Catastrophic Forgetting},
author = {Akshat Gupta and Anurag Rao and Gopala Anumanchipalli},
journal= {arXiv preprint arXiv:2401.07453},
year = {2024}
}
备注
ACL 2024 Findings