中文

LAMP:利用语言模型先验从梯度中提取文本

机器学习 2022-10-20 v2 分布式、并行与集群计算

摘要

近期研究表明,敏感的的用户数据可从梯度更新中重建,从而打破了联邦学习的关键隐私承诺。尽管该成功主要在图像数据上得到证明,这些方法并不能直接迁移到文本等其他领域。本工作中,我们提出 LAMP,一种专为文本数据定制的新型攻击,可成功地从梯度中重建原始文本。我们的攻击基于两个关键洞见:(i) 用辅助语言模型对先验文本概率建模,引导搜索朝向更自然的文本;(ii) 交替进行连续与离散优化,在嵌入上最小化重建损失,同时通过施加离散文本变换避免局部极小。我们的实验表明 LAMP 比先前工作显著更有效:平均多重建 5 倍的二元语法以及长 23% 的子序列。此外,我们首次从文本模型的批大小大于 1 的输入中恢复数据。这些发现表明,处理文本数据的模型的梯度更新所泄露的信息比此前认为的更多。

关键词

引用

@article{arxiv.2202.08827,
  title  = {LAMP: Extracting Text from Gradients with Language Model Priors},
  author = {Mislav Balunović and Dimitar I. Dimitrov and Nikola Jovanović and Martin Vechev},
  journal= {arXiv preprint arXiv:2202.08827},
  year   = {2022}
}