中文

反对抗学习:为大型语言模型脱敏提示词

计算与语言 2025-11-19 v2 人工智能

摘要

随着大型语言模型(LLMs)的广泛使用,保护用户提示词中的隐私变得至关重要,因为提示词有将隐私和敏感数据暴露给云端LLMs的风险。同态加密、安全多方计算和联邦学习等传统技术因计算成本高和用户参与要求而面临挑战,限制了它们在LLM场景中的适用性。在本文中,我们提出了PromptObfus,一种用于脱敏LLM提示词的新方法。PromptObfus的核心思想是“反对抗”学习,它扰动提示词中的隐私词以模糊敏感信息,同时保持模型预测的稳定性。具体而言,PromptObfus将提示词脱敏框架化为一个掩码语言建模任务,用[MASK]标记替换隐私敏感术语。训练一个脱敏模型为每个掩码位置生成候选替换词。随后,基于来自代理模型的梯度反馈选择这些候选词,确保对任务输出的干扰最小。我们在三个NLP任务上展示了我们方法的有效性。结果表明,PromptObfus有效地防止了来自远程LLM的隐私推断,同时保持了任务性能。

关键词

引用

@article{arxiv.2505.01273,
  title  = {Anti-adversarial Learning: Desensitizing Prompts for Large Language Models},
  author = {Xuan Li and Zhe Yin and Xiaodong Gu and Beijun Shen},
  journal= {arXiv preprint arXiv:2505.01273},
  year   = {2025}
}

备注

Accepted to AAAI 2026