通过机器遗忘迈向更安全的大语言模型
计算与语言
2024-06-06 v2
摘要
大语言模型 (LLMs) 的快速发展展示了其在各个领域的巨大潜力,这归功于其广泛的预训练知识和卓越的泛化能力。然而,LLMs 在面对有害提示时往往面临生成有害内容的挑战。为解决这一问题,现有工作尝试实施基于梯度上升的方法以防止 LLMs 产生有害输出。虽然这些方法可能有效,但它们经常影响模型在响应正常提示时的效用。为弥补这一差距,我们引入了选择性知识否定遗忘 (Selective Knowledge negation Unlearning, SKU),这是一种专为 LLMs 设计的新型遗忘框架,旨在消除有害知识的同时保留对正常提示的效用。具体而言,SKU 包含两个阶段:有害知识获取阶段和知识否定阶段。第一阶段旨在识别并获取模型内的有害知识,而第二阶段则致力于移除这些知识。SKU 选择性地隔离并移除模型参数中的有害知识,确保模型在正常提示上的性能保持鲁棒。我们在各种 LLM 架构上进行的实验表明,SKU 在移除有害信息与保留效用之间找到了良好的平衡点。
引用
@article{arxiv.2402.10058,
title = {Towards Safer Large Language Models through Machine Unlearning},
author = {Zheyuan Liu and Guangyao Dou and Zhaoxuan Tan and Yijun Tian and Meng Jiang},
journal= {arXiv preprint arXiv:2402.10058},
year = {2024}
}
备注
Accepted by ACL 2024 Findings