OrchJail:基于编排引导的模仿放大工具调用文本到图像代理
多智能体系统
2026-05-11 v1 人工智能
密码学与安全
摘要
工具调用文本到图像 (T2I) 代理能够规划并执行多步骤工具链,以完成复杂的生成和编辑查询。然而,这一能力引入了新的安全攻击面:有害输出可能源于工具编排,处于单独良好步骤的组合可能产生不安全结果,这使得仅靠提示词的越狱技术不足。我们提出 OrchJail,一个基于编排引导的模仿放大框架,用于攻击工具调用 T2I 代理。其核心思想是利用高风险工具编排模式:通过学习成功的工具调用痕迹及其与提示词措辞之间的因果关系,OrchJail 直接引导模仿放大搜索,以触发更可能产生不安全多步骤工具行为的提示词,而不是依赖表面级的文本扰动。广泛的实验表明,OrchJail 在代表性工具调用 T2I 代理上显著提升了越狱效果和效率,实现了更高的攻击成功率、更好的图像保真度和更低的查询成本,同时对常见的防御措施具有较强鲁棒性。我们的工作揭示了工具编排作为一个关键且此前未被探索的攻击面,并提供了一种新型框架,用于发现 T2I 代理中的安全风险。
引用
@article{arxiv.2605.07414,
title = {OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing},
author = {Jianming Chen and Yawen Wang and Junjie Wang and Zhe Liu and Qing Wang and Fanjiang Xu},
journal= {arXiv preprint arXiv:2605.07414},
year = {2026}
}