中文

基于本地差分隐私数据的分布鲁棒机器学习

机器学习 2020-06-25 v1 密码学与安全 最优化与控制 统计理论 机器学习 统计理论

摘要

我们考虑使用本地差分隐私数据集的机器学习,特别是回归。利用 Wasserstein 距离定义一个以受本地差分隐私噪声污染的数据集经验分布为中心的模糊集。该模糊集被证明包含未加扰动干净数据的概率分布。模糊集的半径是关于隐私预算、数据散布和问题规模的函数。因此,使用本地差分隐私数据集的机器学习可重写为一个分布鲁棒优化问题。对于一般分布,该分布鲁棒优化问题可松弛为一个以机器学习模型的 Lipschitz 常数为正则化项的规则化机器学习问题。对于线性和逻辑回归,该正则化项为模型参数的对偶范数。对于高斯数据,该分布鲁棒优化问题可被精确求解以找到最优正则化项。该方法为训练线性回归模型给出了一种全新的正则化项。使用该新颖正则化项的训练可表述为一个半定规划。最后,所提出的分布鲁棒机器学习训练的性能在实用数据集上得到了验证。

关键词

引用

@article{arxiv.2006.13488,
  title  = {Distributionally-Robust Machine Learning Using Locally Differentially-Private Data},
  author = {Farhad Farokhi},
  journal= {arXiv preprint arXiv:2006.13488},
  year   = {2020}
}