影子无学习:一种面向 LLM 的神经语义忘却方法,实现忘却保真无面部特征
密码学与安全
2026-05-27 v2 人工智能
计算与语言
摘要
机器无学习旨在 selectively 删除特定训练样本的影响,以满足数据保护法规如 GDPR '遗忘权' 的要求。然而,许多现有方法需要访问被删除的数据,导致其暴露于成员推断攻击,并可能滥用可识别个人信息(PII)。我们提出了影子无学习(Shadow Unlearning)——一种近似无学习的新范式,通过对匿名化忘却数据执行机器无学习,避免暴露 PII。我们进一步提出了一种新型隐私保护框架——神经语义投影器无学习(Neuro-Semantic Projector Unlearning, NSPU),以实现影子无学习。为评估该方法,我们构建了跨五个多样领域的虚构无学习(Multi-domain Fictitious Unlearning, MuFU)忘却数据集,并引入评估框架以量化知识保留与无学习效果之间的权衡。实验结果表明,NSPU 在各种 LLM 上实现了优异的无学习性能,保持模型实用性,提升用户隐私。此外,所提方法的计算效率至少是标准无学习方法的 10 倍。我们的发现指引了数据保护与模型保真度之间平衡的新方向。
引用
@article{arxiv.2601.04275,
title = {Shadow Unlearning: A Neuro-Semantic Approach to Fidelity-Preserving Faceless Forgetting in LLMs},
author = {Dinesh Srivasthav P and Ashok Urlana and Rahul Mishra and Bala Mallikarjunarao Garlapati and Ponnurangam Kumaraguru},
journal= {arXiv preprint arXiv:2601.04275},
year = {2026}
}