中文

在 CalTrain 上实现数据机密性与模型可问责性

密码学与安全 2018-12-11 v1 机器学习

摘要

分布式协作学习(DCL)范式使得从不互信的多方参与者构建联合机器学习模型成为可能。数据机密性通过将私有训练数据保留在各参与者的本地基础设施上得到保证。然而,这种实现数据机密性的方法使当今的 DCL 设计从根本上易受数据投毒和后门攻击。它也限制了 DCL 的模型可问责性,而后者是回溯 responsible“不良”训练数据实例/贡献者的关键。本文介绍 CALTRAIN,一个基于可信执行环境(TEE)的集中式多方协作学习系统,同时实现数据机密性与模型可问责性。CALTRAIN 对集中聚合的训练数据强制执行隔离计算以保证数据机密性。为支持构建可问责的学习模型,我们安全地维护训练实例与其对应贡献者之间的链接。我们的评估表明,与非保护环境中训练的模型相比,CALTRAIN 生成的模型可达到相同的预测精度。我们还证明,当恶意训练参与者倾向于在模型训练期间植入后门时,CALTRAIN 能准确且精确地发现导致运行时误预测的投毒及错标训练数据。

关键词

引用

@article{arxiv.1812.03230,
  title  = {Reaching Data Confidentiality and Model Accountability on the CalTrain},
  author = {Zhongshu Gu and Hani Jamjoom and Dong Su and Heqing Huang and Jialong Zhang and Tengfei Ma and Dimitrios Pendarakis and Ian Molloy},
  journal= {arXiv preprint arXiv:1812.03230},
  year   = {2018}
}