中文

TAG:针对基于 Transformer 的语言模型的梯度攻击

密码学与安全 2021-09-22 v6

摘要

尽管联邦学习在有效利用本地设备增强数据隐私方面日益受到关注,近期研究表明在计算机视觉中训练过程公开共享的梯度会向第三方泄露私有训练图像(梯度泄露)。然而,我们对基于 Transformer 的语言模型上的梯度泄露机制尚无系统性理解。本文作为首次尝试,形式化了基于 Transformer 的语言模型上的梯度攻击问题,并提出了一种梯度攻击算法 TAG 以重建本地训练数据。我们开发了一组度量来定量评估所提攻击算法的有效性。在 GLUE 基准上使用 Transformer、TinyBERT4_{4}、TinyBERT6_{6}、BERTBASE_{BASE} 与 BERTLARGE_{LARGE} 的实验结果表明,TAG 在更多权重分布上能良好重建训练数据,且在无需真实标签的情况下,相比先前方法取得了 1.5×\times 恢复率与 2.5×\times ROUGE-2。TAG 通过攻击 CoLA 数据集中的梯度可获得高达 90%\% 的数据。此外,TAG 对大模型、小词典规模与小输入长度具有更强的对抗性。我们希望所提出的 TAG 能为基于 Transformer 的 NLP 模型中的隐私泄露问题提供些许启示。

关键词

引用

@article{arxiv.2103.06819,
  title  = {TAG: Gradient Attack on Transformer-based Language Models},
  author = {Jieren Deng and Yijue Wang and Ji Li and Chao Shang and Hang Liu and Sanguthevar Rajasekaran and Caiwen Ding},
  journal= {arXiv preprint arXiv:2103.06819},
  year   = {2021}
}

备注

Accepted to Findings of EMNLP 2021