解构分类器:面向文本分类模型的数据重构攻击
计算与语言
2023-06-27 v1 密码学与安全
机器学习
摘要
自然语言处理(NLP)模型在文本分类等现实应用中已日益普及。然而,它们易受隐私攻击,包括旨在提取用于训练模型的数据的数据重构攻击。以往关于数据重构攻击的研究大多聚焦于大语言模型(LLM),而分类模型被假定为更安全。在这项工作中,我们提出了一种称为混合匹配(Mix And Match)攻击的新型定向数据重构攻击,它利用了大多数分类模型基于LLM这一事实。混合匹配攻击使用目标模型的基础模型生成候选词元,然后利用分类头对其进行剪枝。我们使用随机和有机金丝雀样本广泛证明了该攻击的有效性。本工作凸显了在分类模型中考虑与数据重构攻击相关的隐私风险的重要性,并为可能的泄露提供了见解。
引用
@article{arxiv.2306.13789,
title = {Deconstructing Classifiers: Towards A Data Reconstruction Attack Against Text Classification Models},
author = {Adel Elmahdy and Ahmed Salem},
journal= {arXiv preprint arXiv:2306.13789},
year = {2023}
}
备注
17 pages, 6 figures, 4 tables