大规模快速模型编辑
机器学习
2022-06-15 v2 人工智能
计算与语言
摘要
虽然大型预训练模型在各种下游任务中取得了令人瞩目的成果,但现有的最大模型仍会犯错,且即使是准确的预测也可能随时间推移而过时。由于在训练阶段检测所有此类失败是不可能的,因此希望能够让此类模型的开发者和最终用户在保持模型其他部分完整的同时修正不准确的输出。然而,大型神经网络所学表示的分布式和黑盒特性使得进行此类针对性编辑变得困难。如果仅提供单个有问题的输入和新的期望输出,微调方法往往会导致过拟合;其他编辑算法要么在计算上不可行,要么在应用于超大型模型时完全无效。为了实现易于扩展的事后编辑,我们提出了基于梯度分解的模型编辑网络(Model Editor Networks using Gradient Decomposition, MEND),这是一组小型辅助编辑网络,利用单个期望的输入 - 输出对对预训练模型的行为进行快速、局部的编辑。MEND 学习转换通过标准微调获得的梯度,利用梯度的低秩分解使该转换的参数化变得可行。即使在拥有超过 100 亿参数的模型上,MEND 也能在单块 GPU 上用不到一天的时间完成训练;一旦训练完成,MEND 即可实现对预训练模型的快速新编辑应用。我们在 T5、GPT、BERT 和 BART 模型上的实验表明,MEND 是唯一能有效编辑超过 100 亿参数模型行为的方法。代码和数据见 https://sites.google.com/view/mend-editing。
引用
@article{arxiv.2110.11309,
title = {Fast Model Editing at Scale},
author = {Eric Mitchell and Charles Lin and Antoine Bosselut and Chelsea Finn and Christopher D. Manning},
journal= {arXiv preprint arXiv:2110.11309},
year = {2022}
}
备注
ICLR 2022. View implementation and additional project info at https://sites.google.com/view/mend-editing