大规模知识清洗
计算与语言
2025-02-18 v3
摘要
大型语言模型在记忆世界知识方面表现出令人印象深刻的能力,这引发了对记忆私人信息、有毒或敏感知识以及版权内容的担忧。我们引入了大规模知识清洗问题,专注于遗忘大量事实知识。之前的遗忘方法通常定义反向损失并通过反向传播更新模型,这可能会影响模型的流畅性和推理能力,甚至由于使用反向损失进行大量训练而破坏模型。现有工作引入下游任务的额外数据以防止模型失去能力,这需要下游任务感知。控制遗忘与维持现有能力的权衡也具有挑战性。为此,我们提出了LAW(大规模清洗)来更新仅解码器大型语言模型中的MLP层以执行知识清洗,受模型编辑方法的启发,并基于知识和推理可分离的假设。我们推导了一个新的目标函数,利用要遗忘的知识来更新某些MLP层的权重。实验结果表明,LAW在遗忘目标知识的同时保持推理能力的有效性。代码将在https://github.com/wangyu-ustc/LargeScaleWashing开源。
引用
@article{arxiv.2405.16720,
title = {Large Scale Knowledge Washing},
author = {Yu Wang and Ruihan Wu and Zexue He and Xiusi Chen and Julian McAuley},
journal= {arXiv preprint arXiv:2405.16720},
year = {2025}
}