谁在测试测试者?LLM 智能体工具调用安全的系统枚举与覆盖审计
软件工程
2026-03-20 v1 密码学与安全
摘要
大型语言模型(LLM)智能体日益通过外部工具进行行动,其安全性取决于工具调用流程而非仅文本生成。尽管近期基准测试在多样化环境和风险类别中评估智能体,但一个根本问题仍未解答:现有测试套件是否完备,以及在智能体通过基准测试后仍潜在的不安全交互模式是什么?我们提出 SafeAudit,一个元审计框架,通过两个贡献解决这一问题。首先,一个基于 LLM 的枚举器,通过系统性地枚举有效的工具调用流程和多样化用户场景生成测试用例。其次,我们引入 rule-resistance,即一种非语义的、量化的指标,从现有基准测试中提炼出简洁的安全规则,并识别在这些规则下仍未覆盖的不安全交互模式。在3个基准测试和12个环境中,SafeAudit 发现超过20%的残留不安全行为是现有基准测试未能暴露的,且随测试预算增加而单调增长覆盖率。我们的结果凸显当前安全评估中的显著完整性缺口,并动机元审计成为基准测试驱动的智能体安全测试不可或缺的补充。
引用
@article{arxiv.2603.18245,
title = {Who Tests the Testers? Systematic Enumeration and Coverage Audit of LLM Agent Tool Call Safety},
author = {Xuan Chen and Lu Yan and Ruqi Zhang and Xiangyu Zhang},
journal= {arXiv preprint arXiv:2603.18245},
year = {2026}
}