自然语言模型更新中的信息泄露分析
机器学习
2021-08-09 v4 计算与语言
密码学与安全
机器学习
摘要
为了持续提升质量并反映数据变化,机器学习应用必须定期重新训练并更新其核心模型。我们表明,对更新前后语言模型快照进行差分分析,可揭示关于训练数据变化的惊人数量的详细信息。我们提出了两个新指标——差分分数(differential score)和差分排序(differential rank)——用于分析自然语言模型更新所导致的信息泄露。我们使用这些指标,对采用不同方法和配置、在多个不同数据集上训练的模型进行了泄露分析。我们讨论了研究发现的隐私影响,提出了缓解策略并评估了其效果。
引用
@article{arxiv.1912.07942,
title = {Analyzing Information Leakage of Updates to Natural Language Models},
author = {Santiago Zanella-Béguelin and Lukas Wutschitz and Shruti Tople and Victor Rühle and Andrew Paverd and Olga Ohrimenko and Boris Köpf and Marc Brockschmidt},
journal= {arXiv preprint arXiv:1912.07942},
year = {2021}
}