基于激活签名的元素表征意识式遗忘:从抑制到实体签名抹除
计算与语言
2026-05-27 v5 机器学习
摘要
实体级别的遗忘通常通过模型输出来评估:即它是否停止引用目标、拒绝查询,或转移真理比例分布。然而,这些输出水平的测试并未显示主体内部表征是否被削弱。我们引入了实体表征遗忘框架(ERUF),该框架通过挖掘主体特定的激活签名、抑制相应的激活方向,并将行为蒸馏到 LoRA 参数中。对于评估的基线方法,ERUF 是唯一同时实现表层抑制、内部削弱和效用保持的方法。在 TOFU forget10 上,ERUF 实现 FQ = 0.99 和 MU = 0.62,匹配报告的 oracle 效用,同时接近 oracle 遗忘质量。在大多数标准基础模型设置下,ERUF 保持低泄露和低内部目标激活,SMR 在 0.00% 到 1.10% 之间,EL10 低于 0.06,效用偏差低于 3%。在 Llama-3.1-8B 上,对抗性实体恢复率从 63.89%降至 20.15%,而无名称依赖的恢复率下降 72.7%,降至 77.4%。联合表层/内部诊断进一步揭示了在推理先验模型中的尺度依赖行为,这些只通过表面指标将无法察觉。我们将这些结果解释为表征层面削弱的实证,绝非不可逆删除的形式性保证。
引用
@article{arxiv.2601.10566,
title = {Representation-Aware Unlearning via Activation Signatures: From Suppression to Entity-Signature Erasure},
author = {Syed Naveed Mahmood and Md. Rezaur Rahman Bhuiyan and Tasfia Zaman and Jareen Tasneem Khondaker and Md. Sameer Sakib and K. M. Shadman Wadith and Nazia Tasnim and Farig Sadeque},
journal= {arXiv preprint arXiv:2601.10566},
year = {2026}
}
备注
16 pages, 4 figures