中文

在尊重隐私及面对分布不确定性与对抗数据鲁棒性下的学习

机器学习 2020-07-09 v1 密码学与安全 信息论 系统与控制 系统与控制 math.IT

摘要

用于训练机器学习模型的数据可能是对抗性的——由对手恶意构造以欺骗模型。当数据在地理上被收集并存储于多个学习方处,其中某些甚至可能持有“匿名”或不可靠的数据集时,隐私、机密性或法律约束也会带来挑战。在此背景下,考虑在集中式与联邦学习设置下采用分布鲁棒优化框架来训练参数化模型。目标是使训练出的模型对对抗性操纵的输入数据,或分布不确定性(如训练与测试数据分布间的不匹配,或不同工作节点所存数据集间的差异)具有鲁棒性。为此,假定数据分布未知,且位于以经验数据分布为中心的Wasserstein球内。该鲁棒学习任务涉及一个无限维优化问题,颇具挑战。利用强对偶结果,获得了一个代理问题,并为此开发了三种随机原始-对偶算法:i) 带ε精度预言机的随机近端梯度下降,其调用预言机求解凸子问题;ii) 随机近端梯度下降-上升,其通过单步梯度上升近似凸子问题的解;以及 iii) 一种分布鲁棒联邦学习算法,其在存储数据的不同工作节点处本地求解子问题。与经验风险最小化及联邦学习方法相比,所提算法以极少计算开销提供了鲁棒性。使用图像数据集的数值测试展示了所提算法在多种现有对抗攻击与分布不确定性下的优势。

关键词

引用

@article{arxiv.2007.03724,
  title  = {Learning while Respecting Privacy and Robustness to Distributional Uncertainties and Adversarial Data},
  author = {Alireza Sadeghi and Gang Wang and Meng Ma and Georgios B. Giannakis},
  journal= {arXiv preprint arXiv:2007.03724},
  year   = {2020}
}

备注

14 pages, 5 figures