利用 ScatterNet 特征的差分隐私核诱导点(DP-KIP-ScatterNet)用于隐私保护数据蒸馏
机器学习
2024-04-23 v2 机器学习
摘要
数据蒸馏旨在生成一个小型数据集,使其在给定学习算法上的表现与原始数据集 closely 相似。因此,得益于数据规模小,蒸馏数据集有助于简化训练过程。然而,蒸馏数据样本未必具有隐私保护性,即便它们通常人类难以辨识。为应对该局限,我们引入了差分隐私核诱导点(DP-KIP)用于隐私保护数据蒸馏。与我们最初仅将 DP-SGD 应用于 KIP 框架的意图不同,我们发现使用无限宽卷积神经正切核(conv-NTKs)的 KIP 比使用全连接 NTKs 的 KIP 表现更好。但是,基于 conv-NTKs 的 KIP 因其卷积与池化操作带来了难以承受的计算复杂度,需数百块 V100 GPU 并行训练,这不切实际,且更重要的是,此类计算资源对许多人而言不可得。为克服该问题,我们提出了一种替代方案,其无需预训练(以避免隐私损失)且能像 conv-NTKs 的特征那样很好地捕捉图像上的复杂信息,同时计算成本可由单块 V100 GPU 承受。为此,我们提出 DP-KIP-ScatterNet,其使用来自散射网络(ScatterNet)的小波特征替代 conv-NTKs 的特征,以合理的计算成本执行 DP-KIP。我们在计算高效的 JAX 中实现了 DP-KIP-ScatterNet,并在多个流行图像数据集上测试,展示了其有效性及在具差分隐私保证的图像数据蒸馏中优于最先进方法的性能。
引用
@article{arxiv.2301.13389,
title = {Differentially Private Kernel Inducing Points using features from ScatterNets (DP-KIP-ScatterNet) for Privacy Preserving Data Distillation},
author = {Margarita Vinaroz and Mi Jung Park},
journal= {arXiv preprint arXiv:2301.13389},
year = {2024}
}