大语言模型中的机器遗忘
计算与语言
2024-05-27 v1 人工智能
摘要
机器遗忘是人工智能领域的一个新兴领域,旨在解决在机器学习模型中选择性地遗忘或减少不良知识或行为的挑战,尤其是在大语言模型 (LLM) 的背景下。本文引入一种方法,通过梯度上升算法实现对 LLM(如 Open Pre-trained Transformer Language Models)进行知识遗忘,以符合伦理、隐私和安全标准。我们的 approach 旨在选择性擦除或修改 LLM 中所学信息,针对有害响应和受版权保护的内容。本文提出了双重策略来增强大语言模型 (LLM) 的伦理和安全行为,通过解决有害响应和受版权保护内容的问题。为缓解有害响应,我们对 PKU 数据集应用了梯度上升,使 Open Pre-trained Transformer Language Models (OPT1.3b 和 OPT2.7b) 的有害响应减少约 75%,同时通过 TruthfulQA 数据集保持先前知识。对于处理受版权保护的内容,我们基于 Lord of the Rings 语料库构建了自定义数据集,并通过 LoRA: Large Language Models 的低秩适应 (Low-Rank Adaptation of Large Language Models) 微调对 LLM (OPT1.3b 和 OPT2.7b) 进行对齐。随后,我们采用梯度上升方法遗忘 Lord of the Rings 内容,显著减少受版权保护材料的存在。为维持多样化的知识库,我们利用 Book Corpus 数据集。此外,我们提出了一种新的评估技术,用于评估有害遗忘的效果。
引用
@article{arxiv.2405.15152,
title = {Machine Unlearning in Large Language Models},
author = {Saaketh Koundinya Gundavarapu and Shreya Agarwal and Arushi Arora and Chandana Thimmalapura Jagadeeshaiah},
journal= {arXiv preprint arXiv:2405.15152},
year = {2024}
}
备注
10 pages