面向鲁棒与平衡的大语言模型无知识学习:双空间光滑性
计算与语言
2026-03-31 v2 人工智能
摘要
随着大语言模型的发展,机器无知识学习(ML)已引发关于用户隐私、版权侵权以及整体安全的日益担忧。然而,现有最先进(SOTA)无知识方法常因遗忘严重且指标失衡而受限,例如过度优化单一目标(如无知识效果、实用性保存或隐私保护),而牺牲其他目标。此外,小扰动在表示空间或参数空间中可能被用于重新学习和越狱攻击。为此,我们提出了 PRISM—a 统一框架,通过在表示空间和参数空间强制双空间光滑性,以提高鲁棒性并平衡无知识指标。PRISM 包含两个光滑优化阶段:(i) 表示空间阶段采用鲁棒训练的探针,以抵御越狱攻击;(ii) 参数空间阶段解耦保留-遗忘梯度冲突,减少失衡,并光滑参数空间以缓解重新学习攻击。在针对 WMDP 和 MUSE 的大规模实验中,我们在对话式对话和连续文本设置下表明,PRISM 在多种攻击下超越 SOTA 基线,同时在关键指标之间实现更好的平衡。
引用
@article{arxiv.2509.23362,
title = {Dual-Space Smoothness for Robust and Balanced LLM Unlearning},
author = {Han Yan and Zheyuan Liu and Meng Jiang},
journal= {arXiv preprint arXiv:2509.23362},
year = {2026}
}
备注
Accepted by ICLR 2026