中文

IDT:面向隐私保护的双任务对抗攻击

计算与语言 2024-07-01 v1 密码学与安全 机器学习

摘要

自然语言处理(NLP)模型可能以各种方式泄露私人信息,包括成员推断、重构或属性推断攻击。敏感信息可能并非在文本中显式出现,但隐藏在 underlying 写作特征中。保护隐私的方法可能涉及使用 demonstrated 不检测敏感属性的模型内部表示的方式,或者在模型获取访问权限之前改变原始文本。目标是重写文本,以防止推断出某些敏感属性(例如作者的性别,或通过写作风格推断其位置),同时保持文本对其原始意图(例如产品评论的情感)有用。已有工作虽然关注生成技术,但这些技术常常会创建与原始文本大相径庭的文本,或面临模式崩溃等问题。本文探索了对抗攻击技术的一种新型适用方法,以操纵文本针对一个任务(隐私)进行欺骗性攻击,同时保持另一个任务(实用性)中分类器的预测不变。我们提出了 IDT 方法,通过分析由辅助且可解释模型所做出的预测来识别哪些标记对于隐私任务重要,需要更改,而哪些标记应保持用于实用性任务。我们对不同的数据集进行了评估。自动评估和人类评估均表明,IDT 在保持文本实用性方面表现出色,同时在针对隐私任务进行欺骗性攻击时优于现有方法。

关键词

引用

@article{arxiv.2406.19642,
  title  = {IDT: Dual-Task Adversarial Attacks for Privacy Protection},
  author = {Pedro Faustini and Shakila Mahjabin Tonni and Annabelle McIver and Qiongkai Xu and Mark Dras},
  journal= {arXiv preprint arXiv:2406.19642},
  year   = {2024}
}

备注

28 pages, 1 figure