中文

净化您的响应:通过自我净化框架缓解大语言模型中的隐私泄露

计算与语言 2025-09-30 v1 密码学与安全 机器学习

摘要

随着大语言模型(LLM)在聊天机器人和代码助理等众多应用中取得显著进展,围绕生成有害内容的担忧日益凸显。尽管在与安全伦理标准对齐方面取得了显著进展, adversarial 提示仍可被精心设计以诱发不可取的响应。现有缓解策略主要基于事后过滤,引入显著的延迟或计算开销,且不适用于基于 token 级别的流式生成。在本工作中,我们引入了 Self-Sanitize,一种受认知心理学启发的新型 LLM 缓解框架,模拟人类在对话中进行自我监控与自我修复的行为。Self-Sanitize 包含一个轻量级的自我监控模块,通过表示工程在 LLM 级别上持续检查高层意图,以及一个自我修复模块,在不启动独立审查对话的情况下对有害内容进行原位纠正。该设计实现了实时流式监控和无缝修复,几乎不影响延迟和资源利用。鉴于隐私侵入内容在以往研究中往往未得到充分关注,我们在四个 LLM 上进行了针对三个隐私泄露情景的广泛实验。结果表明,Self-Sanitize 在最小开销且不降低 LLM 效用的前提下实现了卓越的缓解性能,为更安全的 LLM 部署提供了实用且稳健的解决方案。我们的代码已公开于以下链接提供:https://github.com/wjfu99/LLM_Self_Sanitize

关键词

引用

@article{arxiv.2509.24488,
  title  = {Sanitize Your Responses: Mitigating Privacy Leakage in Large Language Models},
  author = {Wenjie Fu and Huandong Wang and Junyao Gao and Guoan Wan and Tao Jiang},
  journal= {arXiv preprint arXiv:2509.24488},
  year   = {2025}
}