中文

ESCAPED:面向核机器学习算法的高效安全隐私点积框架及其在医疗健康中的应用

机器学习 2020-12-07 v1 密码学与安全

摘要

训练复杂的机器学习模型通常需要大量训练样本。尤其在医疗健康场景中,这些样本可能非常昂贵,意味着单一机构通常自身没有足够的样本。合并来自不同来源的隐私敏感数据通常受到数据安全与数据保护措施的约束。这可能导致通过向变量添加噪声(例如,在 ϵ\epsilon-差分隐私中)或省略某些值(例如,为实现 kk-匿名性)来降低数据质量的方法。其他基于密码学的方法可能导致非常耗时的计算,这对于较大的多组学数据尤其成问题。我们通过引入 ESCAPED(即 Efficient SeCure And PrivatE Dot product framework,高效安全隐私点积框架)来解决此问题,该框架能够在第三方上计算来自多个来源的向量的点积,随后第三方训练基于核的机器学习算法,同时既不牺牲隐私也不添加噪声。我们在 HIV 感染者的药物耐药性预测以及精准医学中的多组学降维与聚类问题上评估了我们的框架。在执行时间方面,我们的框架显著优于最契合的现有方法,且不牺牲算法性能。尽管我们仅展示了对于基于核的算法的益处,我们的框架可为需要来自多个来源的向量点积的进一步机器学习模型开启新的研究机会。

关键词

引用

@article{arxiv.2012.02688,
  title  = {ESCAPED: Efficient Secure and Private Dot Product Framework for Kernel-based Machine Learning Algorithms with Applications in Healthcare},
  author = {Ali Burak Ünal and Mete Akgün and Nico Pfeifer},
  journal= {arXiv preprint arXiv:2012.02688},
  year   = {2020}
}

备注

AAAI 2021, Preprint version of the full paper with supplementary material