中文

别煮沸青蛙:一种用于人类与大语言模型作为文本到图像提示工程师的代理评估基准

计算与语言 2026-05-25 v2

摘要

背景。传统语言模型安全基准评估生成的文本:模型是否输出有害语言、复现偏见或遵循有害指令。当模型被部署为代理时,安全相关的对象从系统所说的话转向其在环境中所做的事,仅评估模型在提示下的响应已不足以解决人工智能所提出的安全挑战。近期发展见证了评估大型语言模型作为代理的基准兴起。我们为此研究方向贡献之一。方法。我们引入别煮沸青蛙(Boiling the Frog),用于评估在企业和办公环境中部署的使用工具的 AI 模型是否易受渐进式攻击。每个情景以良性工作区编辑开头,随后引入风险承担请求。基准聚焦于有状态的多回合评估:一系列情景维持持久的工作区,將风险承担的有效载荷置于受控的位置,以评估最终构件状态是否变得不安全。情景通过基于别煮沸青蛙风险、欧盟 AI 法典第 I 附件和第 III 附件中列明的高风险情境,以及欧盟 AI 法典中关于通用人工智能(GPAI)的实践准则的三级运营风险分类法进行组织。结果。在九模型面板中,综合严格攻击成功率(ASR)为 44.4%。单模型的 ASR 范围从 Claude Haiku 4.5 的 20.5% 到 Gemini 3.1 Flash Lite 的 92.9%,Seed 2.0 Lite 也超过 80%。平均链类别级 ASR 在《实践准则》损失控制情境中达到 93.3%。

关键词

引用

@article{arxiv.2605.22643,
  title  = {Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety},
  author = {Piercosma Bisconti and Matteo Prandi and Federico Pierucci and Federico Sartore and Enrico Panai and Laura Caroli and Yue Zhu and Adam Leon Smith and Luca Nannini and Marcello Galisai and Susanna Cifani and Francesco Giarrusso and Marcantonio Bracale Syrnikov and Daniele Nardi},
  journal= {arXiv preprint arXiv:2605.22643},
  year   = {2026}
}