中文

SoK:跨多源隐私保护训练机器学习模型

密码学与安全 2023-03-14 v2 机器学习

摘要

如今,从多个具有隐私保护的数据源收集高质量训练数据,是训练高性能机器学习模型的关键挑战。潜在的解决方案可打破孤立数据语料库之间的壁垒,从而扩大可供处理的数据范围。为此,学术研究者与工业界供应商近期强烈致力于提出两类主要基于软件构建的主流解决方案:1)安全多方学习(简称 MPL);2)联邦学习(简称 FL)。当我们依据以下五项标准评估上述两类技术时,它们各有优势与局限:安全性、效率、数据分布、训练模型的准确性以及应用场景。为展示研究进展并探讨未来方向的见解,我们深入调研了 MPL 与 FL 的协议与框架。首先,我们定义了跨多源隐私保护训练机器学习模型(简称 TMMPP)问题。随后,我们从技术路线、支持的参与方数量、数据划分、威胁模型以及支持的机器学习模型等方面比较近期 TMMPP 研究,以展现其优势与局限。接着,我们调研并评估了五个流行的 FL 平台。最后,我们讨论了未来解决 TMMPP 问题的潜在方向。

关键词

引用

@article{arxiv.2012.03386,
  title  = {SoK: Training Machine Learning Models over Multiple Sources with Privacy Preservation},
  author = {Lushan Song and Guopeng Lin and Jiaxuan Wang and Haoqi Wu and Wenqiang Ruan and Weili Han},
  journal= {arXiv preprint arXiv:2012.03386},
  year   = {2023}
}

备注

19pages, 4 figures