基于受限知识遗忘的安全对齐
计算与语言
2025-05-27 v1 人工智能
摘要
尽管在安全对齐方面取得了显著进展,大语言模型(LLM)仍易受到越狱攻击。现有防御机制未能充分删除LLM中的有害知识,这使得攻击者能够规避安全措施并生成有害输出。为此,我们提出一种新颖的安全对齐策略,受限知识遗忘(CKU),其主要聚焦于知识定位与保留,以及遗忘有害知识。CKU通过对特定多层感知器(MLP)层中的神经元进行评分,识别与有用知识相关的神经元子集U。在遗忘过程中,CKU剪枝U中神经元的梯度,以保留有价值的知识,同时有效抑制有害内容。实验结果表明,CKU显著提升了模型安全性,而不会损害整体性能,相较于现有方法在安全性与实用性之间实现了更佳平衡。此外,我们对神经元知识灵敏度在各种MLP层上的分析提供了关于安全对齐和模型知识编辑机制的宝贵洞见。
引用
@article{arxiv.2505.18588,
title = {Safety Alignment via Constrained Knowledge Unlearning},
author = {Zesheng Shi and Yucheng Zhou and Jing Li},
journal= {arXiv preprint arXiv:2505.18588},
year = {2025}
}