基于强化学习的自动化提示注入
机器学习
2026-02-23 v1 人工智能
摘要
提示注入是 LLM 代理中最关键的漏洞之一;然而,有效的自动化攻击在优化视角下仍 largely 未被探索。现有方法高度依赖人类红队成员和手工编写的提示,限制了其可扩展性和适应性。我们提出 AutoInject,一个强化学习框架,用于生成通用、可迁移的对抗后缀,同时在攻击成功率和对良性任务的效用保存之间进行联合优化。该黑盒方法支持基于查询的优化以及对未见模型和任务的迁移攻击。仅使用 1.5B 参数的对抗后缀生成器,我们成功地攻破了包括 GPT 5 Nano、Claude Sonnet 3.5 和 Gemini 2.5 Flash 在内的前沿系统,这些系统在 AgentDojo 基准测试中表现出更强的自动化提示注入基线。
引用
@article{arxiv.2602.05746,
title = {Learning to Inject: Automated Prompt Injection via Reinforcement Learning},
author = {Xin Chen and Jie Zhang and Florian Tramèr},
journal= {arXiv preprint arXiv:2602.05746},
year = {2026}
}