AgentSecBench:衡量 LLM 代理中的提示注入、隐私泄露与工具使用完整性
密码学与安全
2026-05-27 v1
摘要
LLM 代理通过统一的生成通道处理受信任指令、检索记录和工具观察。这会将数据流与权限混合:即使无应用策略授权,未受信任的字符串也可能影响携带机密信息的响应或行动提议。我们引入 AgentSecBench 作为形式化安全框架的经验实例。该框架定义了三个游戏——指令完整性、检索保密性和能力完整性——在统一的意图-执行非干涉观念下。它将应用策略表示为对授权观察和能力的投影,区分提示注释与强制投影,衡量对抗优势以及防御措施是否在生成前关闭相关模型可见通道。精确标记实验故意作为三个游戏的一个可观测实例,而非完整语义安全主张:它们测试披露和禁止行动区分器,具有明确的基准真实值。我们在 Qwen3-0.6B 和 Qwen3-1.7B 上对六类防御措施进行评估,使用配对的对抗性和良好控制执行进行测量。结果表明风险降低遵循通道关闭,而模型可见的对抗性能力仍可能被利用。得出的是一种以安全为导向的评估方法:提示文本可以描述边界,而前身投影、能力限制和输出验证可以强制执行边界。
引用
@article{arxiv.2605.26269,
title = {AgentSecBench: Measuring Prompt Injection, Privacy Leakage, and Tool-Use Integrity in LLM Agents},
author = {Faruk Alpay and Taylan Alpay},
journal= {arXiv preprint arXiv:2605.26269},
year = {2026}
}
备注
24 pages, 3 figures. Ancillary files provided