中文

NeuraCrypt:通过随机神经网络隐藏私有健康数据以供公开训练

密码学与安全 2021-06-07 v1 人工智能

摘要

平衡数据隐私与预测效用的需求是医疗健康领域机器学习的核心挑战。特别是,隐私问题导致公共数据集匮乏,使多医院队列构建复杂化,并限制了外部机器学习资源的利用。为弥补这一点,需要新方法使医院等数据所有者能够公开共享其数据集,同时保护患者隐私和建模效用。我们提出 NeuraCrypt,一种基于随机深度神经网络的私有编码方案。NeuraCrypt 使用仅数据所有者知晓的随机构建的神经网络对原始患者数据进行编码,并公开发布编码数据和相关标签。从理论角度看,我们证明从足够丰富的编码函数族中采样,针对具有底层数据分布完整知识且计算能力无界对手提供了定义良好且有意义的隐私概念。我们提议通过随机深度神经网络来近似该编码函数族。在实证上,我们展示了我们的编码对一系列对抗攻击的鲁棒性,并表明 NeuraCrypt 在多种 X 射线任务上达到了与非私有基线相竞争的准确率。此外,我们证明多家医院使用独立的私有编码器可协作训练改进的 X 射线模型。最后,我们发布了一个挑战数据集以鼓励开发针对 NeuraCrypt 的新攻击。

关键词

引用

@article{arxiv.2106.02484,
  title  = {NeuraCrypt: Hiding Private Health Data via Random Neural Networks for Public Training},
  author = {Adam Yala and Homa Esfahanizadeh and Rafael G. L. D' Oliveira and Ken R. Duffy and Manya Ghobadi and Tommi S. Jaakkola and Vinod Vaikuntanathan and Regina Barzilay and Muriel Medard},
  journal= {arXiv preprint arXiv:2106.02484},
  year   = {2021}
}