中文

黑盒护栏逆向工程攻击

密码学与安全 2025-11-07 v1 计算与语言

摘要

大型语言模型(LLM)越来越多地采用护栏来强制执行伦理、法律和应用特定的约束。虽然这些护栏在减轻有害响应方面有效,但它们通过暴露可观察的决策模式引入了新的漏洞类别。本文首次研究了黑盒LLM护栏逆向工程攻击。我们提出了护栏逆向工程攻击(GRA),一种基于强化学习的框架,利用遗传算法驱动的数据增强来逼近受害护栏的决策制定策略。通过迭代收集输入输出对,优先选择发生分歧的情况,并应用有针对性的突变和交叉,our method incrementally converges toward a high-fidelity surrogate of the victim guardrail. 我们在三个广泛部署的商业系统上评估了GRA,namely ChatGPT、DeepSeek和Qwen3,证明其在 less than $85的API成本下即可实现超过0.92的 rule matching rate. 这些发现凸显了护栏提取的实际可行性,揭示了当前LLM安全机制的重大安全风险。我们的发现暴露了当前护栏设计中的关键漏洞,凸显了在LLM部署中需要更健壮防御机制的紧迫性。

关键词

引用

@article{arxiv.2511.04215,
  title  = {Black-Box Guardrail Reverse-engineering Attack},
  author = {Hongwei Yao and Yun Xia and Shuo Shao and Haoran Shi and Tong Qiao and Cong Wang},
  journal= {arXiv preprint arXiv:2511.04215},
  year   = {2025}
}