通过知识编辑对大语言模型进行去毒化
计算与语言
2024-05-29 v5 人工智能
计算机视觉与模式识别
人机交互
机器学习
摘要
本文研究了使用知识编辑技术对大语言模型(LLMs)进行去毒化。我们构建了一个基准测试集 SafeEdit,涵盖九种不安全类别,配备多种强大的攻击提示词,并提供全面的评估指标以进行系统评估。我们使用几种知识编辑方法进行了实验,结果表明知识编辑有潜力高效地对 LLMs 进行去毒化,且对通用性能影响有限。随后,我们提出了一种简单而有效的基线方法,称为术中神经监测去毒化(DINM),仅通过一个实例在几步微调内即可降低 LLMs 的毒性。我们进一步对各种去毒化方法的内部机制进行了深入分析,证明先前的方法(如 SFT 和 DPO)可能仅抑制了毒性参数的激活,而 DINM 在一定程度上减轻了毒性参数本身的毒性,实现了永久性调整。我们希望这些见解能为未来开发去毒化方法以及理解 LLMs 的底层知识机制的研究工作带来启发。代码和基准测试集可在 https://github.com/zjunlp/EasyEdit 获取。
引用
@article{arxiv.2403.14472,
title = {Detoxifying Large Language Models via Knowledge Editing},
author = {Mengru Wang and Ningyu Zhang and Ziwen Xu and Zekun Xi and Shumin Deng and Yunzhi Yao and Qishen Zhang and Linyi Yang and Jindong Wang and Huajun Chen},
journal= {arXiv preprint arXiv:2403.14472},
year = {2024}
}
备注
ACL 2024. Project website: https://zjunlp.github.io/project/SafeEdit Benchmark: https://huggingface.co/datasets/zjunlp/SafeEdit