面向隐私保护机器学习的合成数据集生成
密码学与安全
2023-02-14 v5 人工智能
计算机视觉与模式识别
机器学习
摘要
机器学习(ML)在解决计算机视觉、语音识别、目标检测等诸多问题中取得了巨大成功。这一成功的主要原因在于可用于训练深度神经网络(DNNs)的海量数据集的可用性。然而,若数据集包含医疗或金融记录等敏感信息,则无法公开发布。在此类情况下,数据隐私成为主要关切。加密方法为此问题提供了可能的解决方案,但将其部署于ML应用并非易事,因为它们会严重影响分类精度并带来可观的计算开销。另一种方式是使用混淆技术,但维持视觉隐私与精度之间的良好平衡颇具挑战。本工作中,我们提出一种从原始私有数据集生成安全合成数据集的方法。在我们的方法中,给定在原始数据集上预训练、带批量归一化(BN)层的网络,首先记录逐层BN统计量。接着,利用BN统计量和预训练模型,通过优化随机噪声生成合成数据集,使合成数据匹配原始模型的逐层统计分布。我们在图像分类数据集(CIFAR10)上评估了该方法,表明我们的合成数据可用于从头训练网络,产生合理的分类性能。
引用
@article{arxiv.2210.03205,
title = {Synthetic Dataset Generation for Privacy-Preserving Machine Learning},
author = {Efstathia Soufleri and Gobinda Saha and Kaushik Roy},
journal= {arXiv preprint arXiv:2210.03205},
year = {2023}
}