面向生命周期遗忘承诺管理:度量样本级近似遗忘完整性
机器学习
2024-05-02 v2 密码学与安全
摘要
通过采用更灵活的遗忘定义并调整模型分布以模拟没有目标数据的训练,近似机器遗忘为更繁琐的精确遗忘方法提供了一种资源需求更低的替代方案。然而,目标样本的遗忘完整性——即使在近似算法被忠实执行且没有外部威胁的情况下——在很大程度上仍未被检验,这引发了关于这些近似算法在生命周期内履行其遗忘承诺能力的疑问。在本文中,我们引入了近似遗忘的生命周期遗忘承诺管理任务,并概述了其主要挑战。我们提出了一种旨在评估样本级遗忘完整性的高效度量标准。我们的实证结果证明了该标准在两个关键领域优于成员推理技术:其测量结果与各种遗忘任务中的遗忘完整性具有强相关性,以及其计算效率使其适用于实时应用。此外,我们表明该度量标准能够作为在整个遗忘生命周期中监控遗忘异常(包括欠遗忘和过遗忘)的工具。我们应用该度量标准来评估当前近似算法的遗忘承诺。我们在多个遗忘基准上的分析表明,由于两个主要问题,这些算法未能一致地履行其遗忘承诺:1) 遗忘新数据会显著影响先前请求的数据的遗忘效用;2) 近似算法无法确保不同群体之间公平的遗忘效用。这些见解强调了 LUCM 在整个遗忘生命周期中的至关重要性。我们将很快开源我们新开发的基准。
引用
@article{arxiv.2403.12830,
title = {Towards Lifecycle Unlearning Commitment Management: Measuring Sample-level Approximate Unlearning Completeness},
author = {Cheng-Long Wang and Qi Li and Zihang Xiang and Yinzhi Cao and Di Wang},
journal= {arXiv preprint arXiv:2403.12830},
year = {2024}
}