中文

大语言模型是高级匿名化工具

人工智能 2025-02-04 v2 计算与语言 密码学与安全

摘要

近期关于大语言模型 (LLM) 的隐私研究表明,它们在从在线文本推断个人数据方面达到了接近人类水平的性能。随着模型能力的不断增强,现有的文本匿名化方法目前落后于监管要求和对抗性威胁。在本工作中,我们采取两步来弥合这一差距:首先,我们提出了一种新的设置,用于在面对对抗性 LLM 推断时评估匿名化效果,允许对匿名化性能进行自然测量,同时弥补了先前指标的一些缺陷。然后,在此设置内,我们开发了一种新颖的基于 LLM 的对抗性匿名化框架,利用 LLM 强大的推断能力来指导我们的匿名化过程。我们在真实世界和合成的在线文本上,针对 13 个 LLM 对对抗性匿名化进行了全面的实验评估,并将其与多个基线和工业级匿名化工具进行了比较。我们的评估表明,对抗性匿名化在结果效用和隐私方面均优于当前的商业匿名化工具。我们通过一项人类研究 (n=50) 支持我们的发现,该研究突显了人类对 LLM 匿名化文本的强烈且一致的偏好。

关键词

引用

@article{arxiv.2402.13846,
  title  = {Large Language Models are Advanced Anonymizers},
  author = {Robin Staab and Mark Vero and Mislav Balunović and Martin Vechev},
  journal= {arXiv preprint arXiv:2402.13846},
  year   = {2025}
}

备注

International Conference on Learning Representations (ICLR 2024)