中文

通过互信息正则化提升对模型反演攻击的鲁棒性

密码学与安全 2020-09-23 v2 机器学习

摘要

本文研究针对模型反演(MI)攻击的防御机制——一类旨在给定目标机器学习模型访问权限下推断训练数据分布信息的隐私攻击。现有防御机制依赖于模型特定的启发式方法或噪声注入。尽管能够缓解攻击,现有方法显著妨碍模型性能。如何设计一种适用于多种模型并取得更优效用-隐私权衡的防御机制仍是一个问题。本文中,我们提出基于互信息正则化的防御(MID)以对抗MI攻击。其核心思想是限制预测中所包含的关于模型输入的信息,从而限制 adversary 从模型预测推断私有训练属性的能力。我们的防御原则是模型无关的,并给出了线性回规、决策树和神经网络上该正则化项的可处理近似,这些模型若不加任何防御已被先前工作成功攻击。我们通过设计严格的基于博弈的定义并量化相关信息泄露,对MI攻击进行了形式化研究。我们的理论分析揭示了差分隐私(DP)在防御MI攻击上无效的原因,这已在若干先前工作中被经验观察到。实验表明,MID针对多种MI攻击、目标模型和数据集均取得了最先进的性能。

关键词

引用

@article{arxiv.2009.05241,
  title  = {Improving Robustness to Model Inversion Attacks via Mutual Information Regularization},
  author = {Tianhao Wang and Yuheng Zhang and Ruoxi Jia},
  journal= {arXiv preprint arXiv:2009.05241},
  year   = {2020}
}