机器学习中的隐私问题综述
机器学习
2020-05-20 v1 人工智能
密码学与安全
计算机与社会
机器学习
摘要
过去几年中,Google、Microsoft和Amazon等提供商已开始向客户提供软件接口,使其能轻松将机器学习任务嵌入自身应用。总体上,组织现在可使用机器学习即服务(MLaaS)引擎外包复杂任务,例如训练分类器、执行预测、聚类等。它们也可让他人查询基于其数据训练的模型。自然地,这种方法也可(且常被提倡)用于其他场景,包括政府协作、公民科学项目和商业对商业合作。然而,若恶意用户能够恢复用于训练这些模型的数据,由此引发的信息泄露将造成严重问题。同样,若模型内部参数被视为专有信息,则对模型的访问不应允许对手学习此类参数。在本文中,我们旨在综述该领域的隐私挑战,对相关研究文献进行系统性回顾,并探讨可能的对策。更具体地,我们提供关于机器学习与隐私相关概念的充足背景信息。随后,我们讨论可能的对抗模型与设定,涵盖范围广泛的与私有和/或敏感信息泄露相关的攻击,并回顾近期抵御此类攻击的尝试。最后,我们以一列需更多工作的开放问题作结,包括更好评估的需求、更具针对性的防御,以及其与政策和数据保护工作的关系研究。
引用
@article{arxiv.2005.08679,
title = {An Overview of Privacy in Machine Learning},
author = {Emiliano De Cristofaro},
journal= {arXiv preprint arXiv:2005.08679},
year = {2020}
}