中文

LeakAgent:基于强化学习的LLM隐私泄露红队测试智能体

密码学与安全 2025-08-11 v2 人工智能 机器学习

摘要

最近的研究发现,大型语言模型(LLM)可能在精心构建的对抗性提示下被“误导”输出私人信息,包括训练数据、系统提示和可识别个人信息。现有隐私泄露红队测试方法要么依赖人工工作,要么仅聚焦系统提示提取,对训练数据泄露的严重风险效果不佳。我们提出LeakAgent,一个用于LLM隐私泄露的novel黑盒红队测试框架。该框架通过强化学习训练开源LLM作为攻击智能体,生成用于训练数据提取和系统提示提取的对抗性提示。为此,我们提出了新的奖励函数以提供有效且细粒度的奖励,并设计了新的机制在学习过程中平衡探索与开发,增强对抗性提示的多样性。通过大规模评估,我们首先展示LeakAgent在训练数据提取和自动化方法中显著优于现有基于规则的方法。我们还展示了LeakAgent从OpenAI GPT Store中实际应用中的系统提示提取效果。我们进一步展示了LeakAgent在规避现有警戒防御方面的有效性,以及其在实现更好安全对齐方面的有益性。最后,我们通过详细的消融研究验证了自定义设计。我们在此发布代码 https://github.com/rucnyz/LeakAgent。

关键词

引用

@article{arxiv.2412.05734,
  title  = {LeakAgent: RL-based Red-teaming Agent for LLM Privacy Leakage},
  author = {Yuzhou Nie and Zhun Wang and Ye Yu and Xian Wu and Xuandong Zhao and Wenbo Guo and Dawn Song},
  journal= {arXiv preprint arXiv:2412.05734},
  year   = {2025}
}

备注

Accepted by COLM 2025