你遗忘了吗?一种评估机器学习模型是否已遗忘数据的方法
计算机视觉与模式识别
2020-07-14 v2
摘要
在深度学习时代,从多个来源聚合数据是确保数据多样性的常见方法。我们考虑这样一个场景:多个提供方为一个联盟贡献数据以联合开发分类模型(以下称目标模型),但如今其中一个提供方决定退出。该提供方要求其数据(以下称查询数据集)从数据库中删除,同时也要求模型“遗忘”其数据。在本文中,我们首次试图解决模型是否已遗忘数据的这一挑战性问题。我们假设已知查询数据集和模型输出的分布。我们建立了统计方法,将目标的输出与用不同数据集训练的模型的输出进行比较。我们在多个基准数据集(MNIST、CIFAR-10 和 SVHN)上以及使用来自 Automated Cardiac Diagnosis Challenge (ACDC) 的数据的心脏病理诊断任务上评估了我们的方法。我们希望鼓励关于模型保留了什么信息的研究,并启发在更复杂设定下的扩展。
引用
@article{arxiv.2004.10129,
title = {Have you forgotten? A method to assess if machine learning models have forgotten data},
author = {Xiao Liu and Sotirios A Tsaftaris},
journal= {arXiv preprint arXiv:2004.10129},
year = {2020}
}
备注
Accepted by MICCAI 2020