中文

TraceSafe:多步骤工具调用轨迹上LLM防御的系统评估

密码学与安全 2026-04-09 v1 人工智能 计算与语言 机器学习 软件工程

摘要

随着大语言模型(LLM)从静态聊天机器人演变为自主智能体,其主要的安全威胁表面从最终输出转向中间执行轨迹。虽然自然语言响应的安全防御已得到广泛基准测试,但其在多步骤工具使用轨迹中的有效性仍鲜有探索。为填补这一空白,我们引入TraceSafe-Bench,这是第一个专为评估中期轨迹安全而设计的全面基准测试。它涵盖12个风险类别,涵盖从安全威胁(如提示注入、隐私泄露)到运营故障(如幻觉、界面不一致)的风险,包含超过1,000个独特的执行实例。我们对13个LLM-as-a-guard模型和7个专用防御措施进行评估,得出三个关键发现:1)结构性瓶颈:防御有效性更多来自结构化数据能力(如JSON解析)而非语义安全对齐。性能与结构化到文本基准测试高度相关(ρ=0.79\rho=0.79),但与标准越狱鲁棒性几乎无关。2)架构优于规模:模型架构对风险检测性能的影响远大于模型规模,通用型LLM在轨迹分析中始终优于专用安全防御措施。3)时间稳定性:准确率在延长的轨迹中保持稳定。增加的执行步骤使模型能够从静态工具定义转向动态执行行为,实际上在后期阶段提升了风险检测性能。我们的发现表明,保障智能体工作流程需要同时优化结构化推理与安全对齐,以有效缓解中期轨迹风险。

关键词

引用

@article{arxiv.2604.07223,
  title  = {TraceSafe: A Systematic Assessment of LLM Guardrails on Multi-Step Tool-Calling Trajectories},
  author = {Yen-Shan Chen and Sian-Yao Huang and Cheng-Lin Yang and Yun-Nung Chen},
  journal= {arXiv preprint arXiv:2604.07223},
  year   = {2026}
}