中文

揭示被遗忘权背景下预测不确定性的脆弱性

机器学习 2025-08-12 v1

摘要

当前,已有多种不确定性量化方法被提出,用于为深度学习模型的标签预测提供确定性和概率估计。与此同时,随着对被遗忘权需求的日益增长,机器遗忘学习作为一种无需从头重新训练模型即可从预训练模型中移除所请求的敏感数据影响的方法,已被广泛研究。然而,这类生成的预测不确定性在面对专门恶意遗忘攻击时的脆弱性仍未被探索。为填补这一空白,我们首次提出了一类针对预测不确定性的新型恶意遗忘攻击,攻击者的目标是实现对特定预测不确定性结果的期望操控。我们还为我们的攻击设计了新颖的优化框架,并进行了包括黑盒场景在内的广泛实验。值得注意的是,我们的大量实验表明,与专注于标签错误分类的传统攻击相比,我们的攻击在操控预测不确定性方面更为有效,且针对传统攻击的现有防御措施对我们的攻击无效。

关键词

引用

@article{arxiv.2508.07458,
  title  = {Towards Unveiling Predictive Uncertainty Vulnerabilities in the Context of the Right to Be Forgotten},
  author = {Wei Qian and Chenxu Zhao and Yangyi Li and Wenqian Ye and Mengdi Huai},
  journal= {arXiv preprint arXiv:2508.07458},
  year   = {2025}
}