中文

自然语言模型更新中的信息泄露分析

机器学习 2021-08-09 v4 计算与语言 密码学与安全 机器学习

摘要

为了持续提升质量并反映数据变化,机器学习应用必须定期重新训练并更新其核心模型。我们表明,对更新前后语言模型快照进行差分分析,可揭示关于训练数据变化的惊人数量的详细信息。我们提出了两个新指标——差分分数(differential score)和差分排序(differential rank)——用于分析自然语言模型更新所导致的信息泄露。我们使用这些指标,对采用不同方法和配置、在多个不同数据集上训练的模型进行了泄露分析。我们讨论了研究发现的隐私影响,提出了缓解策略并评估了其效果。

关键词

引用

@article{arxiv.1912.07942,
  title  = {Analyzing Information Leakage of Updates to Natural Language Models},
  author = {Santiago Zanella-Béguelin and Lukas Wutschitz and Shruti Tople and Victor Rühle and Andrew Paverd and Olga Ohrimenko and Boris Köpf and Marc Brockschmidt},
  journal= {arXiv preprint arXiv:1912.07942},
  year   = {2021}
}