通过激活修补测量 LLM 忘却的深度
计算与语言
2026-05-26 v1 人工智能
机器学习
摘要
大语言模型 (LLM) 的忘却已成为隐私保护和人工智能安全的关键后期机制,但审计目标知识是否被真正抹除 remains 挑战性。现有的输出级指标无法检测该知识是否仍可从内部表示中恢复。 recent 的白盒研究揭示了此类残余知识,但往往依赖辅助训练或数据集特定的适应,缺乏可通用的度量标准。为克服这些限制,我们提出了忘却深度分数 (Unlearning Depth Score, UDS),一种通过激活修补量化忘却机制深度的度量标准。UDS 首先识别编码目标知识的层,然后在忘却模型中衡量其被抹除的程度,以 0-1 比例表示。在跨 20 个指标、150 个忘却模型(覆盖 8 种方法)的元评估中,UDS 实现了最高的忠实度和鲁棒性,确认其因果方法作为忘却评估的最可靠方法。案例研究进一步揭示,白盒度量标准在层级上可能相互矛盾,并且擦除深度在不同示例间存在差异。我们提供将 UDS 集成到现有基准框架中并优化评估流程的指南。代码和数据已提供于 https://github.com/gnueaj/unlearning-depth-score。
引用
@article{arxiv.2605.24614,
title = {Measuring the Depth of LLM Unlearning via Activation Patching},
author = {Jaeung Lee and Dohyun Kim and Jaemin Jo},
journal= {arXiv preprint arXiv:2605.24614},
year = {2026}
}
备注
18 pages