DurableUn:机器不可学习中的量化诱导恢复攻击
机器学习
2026-05-11 v2
摘要
机器不可学习旨在删除指定的训练数据以满足数据保护法规如 GDPR。然而,现有评估假设不可学习与部署时的精度相同,忽视了生产环境中的 LLM 通常以低位精度部署的事实。我们表明,INT4 量化系统性地恢复被遗忘的内容,即使在 bfloat16 (BF16) 下通过合规审计。我们称之为量化恢复攻击 (quantization recovery attack, QRA)。我们对 NF4+LoRA 体系结构下 INT4 适配器空间的不可学习鲁棒性进行了首次系统性研究,在 LLaMA-3-8B-Instruct 上评估了七种方法,涵盖 TOFU、MUSE-News 和 WikiBio-WPU。INT8 无害;INT4 导致恢复最高可达 22 倍,且随数据集难度而恶化。我们识别出 FA-RA-Q-INT4 三难:无法同时实现强记忆抹除、高实用性和量化鲁棒性。稠密 Pareto 扫描揭示,一旦实现鲁棒性,准确率就会急剧下降,无论进一步调优如何。为此,我们提出 DURABLEUN-SAF (Sharpness-Aware Forgetting),一种针对 INT4 四舍五入的量化感知目标,采用直通估计器通过 INT4 满足梯度。DURABLEUN-SAF 是唯一实现稳定实证 (0.047, {BF16, INT8, INT4}) 持久性认证的方法:Q-INT4= 0.043 ± 0.002,认证率= 3/3,而 SalUn 的认证率仅为 1/3 且使用其已发布的超参数。我们呼吁将 Q-INT4 作为 FA 和 RA 的标准评估指标。
引用
@article{arxiv.2605.02196,
title = {DurableUn: Quantization-Induced Recovery Attacks in Machine Unlearning},
author = {Abdullah Ahmad Khan and Ferdous Sohel},
journal= {arXiv preprint arXiv:2605.02196},
year = {2026}
}