Text Revealer:针对 Transformer 的模型反演攻击下的私有文本重建
计算与语言
2022-09-22 v1
摘要
文本分类已在情感分析等多种自然语言处理应用中被广泛使用。当前应用常使用基于大型 transformer 的语言模型对输入文本进行分类。然而,关于在发布模型时有多少私有信息可被反演,尚缺乏系统性研究。本文提出 Text Revealer——首个针对基于 transformer 的文本分类的用于文本重建的模型反演攻击。我们的攻击在可访问目标模型的情况下,忠实地重建训练数据中包含的私有文本。我们利用外部数据集与 GPT-2 生成目标领域风格流畅文本,随后借助目标模型的反馈对其隐藏状态进行最优扰动。我们的大量实验表明,我们的攻击对具有不同文本长度的数据集均有效,并能以准确率重建私有文本。
引用
@article{arxiv.2209.10505,
title = {Text Revealer: Private Text Reconstruction via Model Inversion Attacks against Transformers},
author = {Ruisi Zhang and Seira Hidano and Farinaz Koushanfar},
journal= {arXiv preprint arXiv:2209.10505},
year = {2022}
}