多方机器学习中的污染攻击及其缓解
密码学与安全
2019-01-09 v1 机器学习
摘要
机器学习对数据有渴求;模型在训练时访问的数据越多,在推理时表现良好的可能性就越大。不同的参与方可能希望合并其本地数据,以获得在大型语料数据上训练模型的益处。我们考虑这样一种情形:参与方获得在其联合数据上训练的模型访问权限,但彼此看不到对方的独立数据集。我们表明,在使用这种多方模型时需要谨慎,因为潜在的恶意参与方可以通过提供受污染的数据来污染模型。随后我们展示了对抗训练如何通过对模型学习特定于各参与方数据的趋势进行阻止,从而防御此类攻击,同时也保证了参与方级别的成员隐私。
引用
@article{arxiv.1901.02402,
title = {Contamination Attacks and Mitigation in Multi-Party Machine Learning},
author = {Jamie Hayes and Olga Ohrimenko},
journal= {arXiv preprint arXiv:1901.02402},
year = {2019}
}