中文

通过对抗蒸馏自精炼的语言模型匿名化器

计算与语言 2025-10-27 v2 机器学习

摘要

大型语言模型(LLMs)越来越多地应用于敏感领域,其从看似无害的文本中推断个人数据的能力带来了新兴的隐私风险。虽然最近基于 LLM 的匿名化方法有助于减轻此类风险,但它们通常依赖专有模型(例如 GPT-4),引发了对成本以及敏感数据暴露给不可信外部系统的担忧。为了解决这个问题,我们引入了 SElf-refining Anonymization with Language model(SEAL),这是一种新颖的蒸馏框架,用于训练小型语言模型在推理时不依赖外部模型即可执行有效的匿名化。SEAL 利用 LLM 匿名化器和推理模型之间的对抗交互,收集匿名化文本和推断属性的轨迹,然后通过监督微调和偏好学习将匿名化和批评能力蒸馏到 SLM 中。生成的模型既学会了匿名化文本,也学会了评估其输出,从而通过自精炼实现匿名化质量的迭代改进。在 SynthPAI(一个包含合成个人资料和文本评论的数据集)上的实验表明,使用 SEAL 训练的 SLM 在匿名化能力方面取得了显著提升。值得注意的是,8B 模型实现了与 GPT-4 匿名化器相当的隐私-效用权衡,并且通过自精炼,甚至在隐私保护方面超越了它。这些结果突显了我们对抗蒸馏框架在训练 SLM 作为高效匿名化器方面的有效性。

关键词

引用

@article{arxiv.2506.01420,
  title  = {Self-Refining Language Model Anonymizers via Adversarial Distillation},
  author = {Kyuyoung Kim and Hyunjun Jeon and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2506.01420},
  year   = {2025}
}

备注

NeurIPS 2025