RL 是锤子而 LLM 是钉子:面向强提示注入的简单强化学习配方
密码学与安全
2025-10-07 v1 机器学习
摘要
提示注入构成对 LLM 智能体可靠性和安全性的严重威胁。近期针对提示注入的防御措施,如 Instruction Hierarchy 和 SecAlign,显示出针对静态攻击的显著鲁棒性。然而,为更全面评估这些防御措施的鲁棒性,显然需要采用诸如自动红队攻击等强大攻击手段。为此,我们引入 RL-Hammer,这是一种用于训练自动学习执行强提示注入和越狱的攻击模型的简单配方。RL-Hammer 无需预热数据,可从头开始进行训练。为实现对具有防御措施的工业级模型实现高 ASRs,我们提出了一套实用技术,使攻击具有高度有效性和普遍性。使用该管道,RL-Hammer 对 GPT-4o 的 ASR 达到 98%,对带有 Instruction Hierarchy 防御的 GPT-5 的 ASR 达到 。我们进一步讨论了在攻击中实现高多样性的挑战,指出攻击模型倾向于奖励 hak 多样性目标。最后,我们表明 RL-Hammer 能够躲避多种提示注入检测器。我们希望本工作推动自动红队攻击,并激励开发更强大、更原则化的防御措施。代码地址:https://github.com/facebookresearch/rl-injector。
引用
@article{arxiv.2510.04885,
title = {RL Is a Hammer and LLMs Are Nails: A Simple Reinforcement Learning Recipe for Strong Prompt Injection},
author = {Yuxin Wen and Arman Zharmagambetov and Ivan Evtimov and Narine Kokhlikyan and Tom Goldstein and Kamalika Chaudhuri and Chuan Guo},
journal= {arXiv preprint arXiv:2510.04885},
year = {2025}
}