提示攻击揭示取消学习方法中的浅层知识移除
密码学与安全
2025-08-15 v2 人工智能
计算与语言
计算机与社会
机器学习
摘要
在本工作中,我们表明,某些机器取消学习方法可能在直接的提示攻击下失效。我们系统评估了八种取消学习技术,涵盖三个模型家族,运用基于输出、逻辑值和探针分析,评估所谓已取消学习的知识可被检索的程度。虽然 RMU 和 TAR 等方法表现出稳健的取消学习,但 ELM 仍对特定提示攻击敏感(例如,在原始提示前添加印度填充文本可恢复 57.3% 的准确率)。我们的逻辑分析进一步表明,已取消学习的模型不太可能通过更改答案格式来隐藏知识,因为输出准确率与逻辑值准确率高度相关。这些发现挑战了关于取消学习有效性的既有假设,凸显了需要能够可靠区分真正知识移除与浅层输出抑制的评估框架的重要性。为促进进一步的研究,我们公开发布了我们的评估框架,以便轻松评估检索已取消学习知识的提示技术。
引用
@article{arxiv.2506.10236,
title = {Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods},
author = {Yeonwoo Jang and Shariqah Hossain and Ashwin Sreevatsa and Diogo Cruz},
journal= {arXiv preprint arXiv:2506.10236},
year = {2025}
}
备注
19 pages, 6 figures. Accepted at COLM 2025 SoLaR Workshop