中文

AI 代理安全基准的分类学与一致性分析

计算机与社会 2026-05-19 v1 人工智能

摘要

基于大型语言模型的自主 AI 代理快速部署带来了超越传统 LLM 范围的安全风险,自2023年末以来引发安全基准的激增。然而,这些基准独立发展,存在不一致的威胁模型、不兼容的指标以及覆盖不完整的风险。我们首次系统性分析专注于代理安全基准作为评估工具。我们列出40个行为代理安全基准(2023-2026年),以及5个相邻评估工具、防御性工具与数据集制品,提出六轴基准评估方法学分类学,并对整个语料库进行应用,以刻画方法选择如何塑造安全结论。覆盖矩阵显示风险覆盖广泛但方法学收敛有限,分类学分析显示行为基准核心集中在沙箱化、受限环境以及常为仅安全评估中。整个景观中,我们发现基准选择可能导致矛盾的安全结论,覆盖计数常高估评估深度,环境保真度系统性影响报告的安全性,领域过度测试外部强加而非代理内部风险,指标碎片化限制比较,鲁棒性实际上未被基准化。我们以95%置信区间和Kendall's W Concordance 分析为依据,发现在评估维度上无排名一致性证据(W=0.10, p=0.94)。我们发布结构化元数据、完整分类学编码、风险标注及所有实验制品,并提出未来基准的最低报告标准。

关键词

引用

@article{arxiv.2605.16282,
  title  = {Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents},
  author = {Miles Q. Li and Benjamin C. M. Fung and Boyang Li and Heba Ismail and Farkhund Iqbal},
  journal= {arXiv preprint arXiv:2605.16282},
  year   = {2026}
}