PUMA:用于训练数据移除的性能不变模型增强
机器学习
2022-03-03 v1 机器学习
摘要
在移除标记训练数据点独特特征的同时保持已训练模型的性能是一项挑战。近期研究通常建议使用剩余训练数据从头重新训练模型,或通过撤销对标记数据点的模型优化来精炼模型。不幸的是,除了计算效率低下外,这些方法不可避免地损害了最终模型的泛化能力,因为它们不仅移除了独特特征,还丢弃了共享(且可能有益的)信息。为解决性能退化问题,本文提出了一种名为性能不变模型增强(PUMA)的新方法。所提出的PUMA框架显式地建模了每个训练数据点对模型在各种性能标准下泛化能力的影响。然后,它通过最优地重新加权剩余数据来弥补移除标记数据带来的负面影响。为证明PUMA框架的有效性,我们在实验中将其与多种最先进的数据移除技术进行了比较,结果显示PUMA能够有效且高效地移除标记训练数据的独特特征,无需重新训练模型,即可1)欺骗成员推理攻击,2)抵抗性能退化。此外,由于PUMA在其运行过程中估计数据重要性,我们证明它可以比现有方法更有效地用于调试错误标记的数据点。
引用
@article{arxiv.2203.00846,
title = {PUMA: Performance Unchanged Model Augmentation for Training Data Removal},
author = {Ga Wu and Masoud Hashemi and Christopher Srinivasa},
journal= {arXiv preprint arXiv:2203.00846},
year = {2022}
}