组织图通信的隐私与机密性研究
密码学与安全
2021-05-31 v1 计算与语言
机器学习
摘要
在組織通信数据(如企业中的电子邮件)上训练的机器学习模型,即使仅用于内部使用,也带来泄露机密性的独特风险。本文展示了企业中机密性与隐私的区别,旨在利用差分隐私原理制定在保护机密性的同时利用数据的方法。目标是在组织中使用人际通信执行机器学习任务(如学习语言模型或进行主题分析),同时不学到组织中共享的机密信息。将差分隐私技术应用于自然语言处理任务的工作通常假设数据独立同分布,并忽视记录间潜在的相关性。忽略此相关性会导致虚构的隐私承诺。朴素地将差分隐私技术从记录级隐私转向群体隐私是直接缓解该问题的途径。此方法虽提供更现实的隐私保证,但过于谨慎并严重损害模型效用。我们在两个语言任务上展示了这两种极端隐私度量间的差距,并引入一种折中方案。我们提出一个捕捉社交网络图中相关性的模型,并通过Pufferfish隐私原理将此相关性纳入隐私计算。
引用
@article{arxiv.2105.13418,
title = {On Privacy and Confidentiality of Communications in Organizational Graphs},
author = {Masoumeh Shafieinejad and Huseyin Inan and Marcello Hasegawa and Robert Sim},
journal= {arXiv preprint arXiv:2105.13418},
year = {2021}
}
备注
10 pages