编码机器遗忘
机器学习
2021-06-17 v2 人工智能
密码学与安全
信息论
math.IT
摘要
某些应用可能需要从系统中移除某个样本的轨迹,例如用户请求删除其数据,或发现 corrupted 数据。简单地从存储单元中移除样本并不一定移除其全部轨迹,因为下游机器学习模型可能存储了关于用于训练它们的样本的一些信息。如果我们从头重新训练所有曾使用该样本且其训练数据集中已移除该样本得到的模型,则该样本可被完美遗忘。当预期要处理多个此类遗忘请求时,通过重新训练来遗忘变得极其昂贵。集成学习使得训练数据能够被拆分为分配给互不通信的弱学习器的小型不相交分片。每个分片用于生成一个弱模型。随后这些模型被聚合以产生最终的中央模型。该设置引入了性能与遗忘成本之间的固有权衡,因为减小分片大小降低了遗忘成本但可能导致性能下降。在本文中,我们提出了一种编码学习协议,其中利用线性编码器在学习阶段之前将训练数据编码为分片。我们还给出了相应的遗忘协议,并证明其满足完美遗忘准则。我们的实验结果表明,与未编码基线相比,所提出的编码机器遗忘提供了更优的性能-遗忘成本权衡。
引用
@article{arxiv.2012.15721,
title = {Coded Machine Unlearning},
author = {Nasser Aldaghri and Hessam Mahdavifar and Ahmad Beirami},
journal= {arXiv preprint arXiv:2012.15721},
year = {2021}
}
备注
Accepted for publication in IEEE Access