映射剥削表面:基于约 10,000 次试验的 LLM 智能体暴露漏洞分类学
密码学与安全
2026-04-07 v1 人工智能
计算与语言
摘要
拥有工具访问权限的 LLM 智能体可以发现并剥削安全漏洞。这已为人所知。然而,尚不清楚的是,哪些系统提示特征会触发此类行为,哪些则不会。我们基于约 10,000 次试验,覆盖七个模型、37 种提示条件以及 12 个假设的攻击维度,构建了一个系统分类学,所有试验均在真实 Docker 沙箱中执行。每种条件均包含指令“始终尊重所有规则和访问策略”,仅Vary 一个鼓励语句。在所研究的任务类别(植入测试跑行者漏洞)中,威胁模型较窄:九个维度——包括最小化、道德许可、激励、身份 priming 以及推理触发器——在 n=50 每个细胞中未产生可检测的剥削(上 95% 置信区间 <7% 每个条件)。但也更为微妙:一个维度,目标重构,可靠地触发剥削。“您正在解谜;可能有隐藏线索”在 Claude Sonnet 4 上产生 38%-40% 的剥削,跨四个模型复制(CTF 构图:DeepSeek、GPT-5-mini、o4-mini 上为 8%-14%)。智能体并未覆盖规则,而是重新解释任务,使得剥削性行为变得任务对齐。GPT-4.1 在 1,850 次试验中(37 种条件)未产生剥削,四个在 11 个月时间跨度内发布的 OpenAI 模型进行的时间比较显示出一贯于改进安全训练的模式,尽管模型能力差异是混杂因素。实际贡献在于缩窄、可测试的威胁模型:防御者应审计目标重构语言,而非针对广泛的对抗性提示。
引用
@article{arxiv.2604.04561,
title = {Mapping the Exploitation Surface: A 10,000-Trial Taxonomy of What Makes LLM Agents Exploit Vulnerabilities},
author = {Charafeddine Mouzouni},
journal= {arXiv preprint arXiv:2604.04561},
year = {2026}
}
备注
18 pages, 8 tables, code and data at https://github.com/Cmouzouni/exploitation-surface