中文

PII 的一生——一种 PII 混淆 Transformer

计算与语言 2023-07-19 v2 信息检索 信息论 math.IT

摘要

在如今 Large Language Models (LLMs,大语言模型) 和数据驱动服务盛行的世界中,保护敏感信息至关重要。一种常用的隐私保护方法是通过数据扰动技术,在保持(敏感)个人可识别信息 (Personal Identifiable Information, PII) 的统计与语义属性的同时,降低其过度可用的效用。数据扰动方法常导致显著的信息损失,使其不实用。本文提出“PII 的一生”(Life of PII),一种新颖的混淆 Transformer 框架,用于将 PII 转换为伪 PII,同时尽可能保留原始信息、意图与上下文。我们的方法包含一个与给定文档交互的 API、一个基于配置的混淆器,以及一个基于 Transformer 架构的模型;该架构在自然语言处理任务和 LLM 中展现出高上下文保持与性能。我们基于 Transformer 的方法学习原始 PII 与其转换后的伪 PII 表示(我们称之为“混淆”数据)之间的映射。实验表明,我们的方法 Life of PII 在效用保持与隐私保护两方面均优于传统数据扰动技术。我们证明该方法能在保持原始信息的同时有效减少效用损失,并在隐私保护与数据效用之间提供更大的权衡灵活性。我们的工作为各类真实应用场景中的 PII 保护提供了解决方案。

关键词

引用

@article{arxiv.2305.09550,
  title  = {Life of PII -- A PII Obfuscation Transformer},
  author = {Ajinkya Deshmukh and Saumya Banthia and Anantha Sharma},
  journal= {arXiv preprint arXiv:2305.09550},
  year   = {2023}
}

备注

7 pages, 1 figure