TraceSafe:多步骤工具调用轨迹上LLM防御的系统评估
密码学与安全
2026-04-09 v1 人工智能
计算与语言
机器学习
软件工程
摘要
随着大语言模型(LLM)从静态聊天机器人演变为自主智能体,其主要的安全威胁表面从最终输出转向中间执行轨迹。虽然自然语言响应的安全防御已得到广泛基准测试,但其在多步骤工具使用轨迹中的有效性仍鲜有探索。为填补这一空白,我们引入TraceSafe-Bench,这是第一个专为评估中期轨迹安全而设计的全面基准测试。它涵盖12个风险类别,涵盖从安全威胁(如提示注入、隐私泄露)到运营故障(如幻觉、界面不一致)的风险,包含超过1,000个独特的执行实例。我们对13个LLM-as-a-guard模型和7个专用防御措施进行评估,得出三个关键发现:1)结构性瓶颈:防御有效性更多来自结构化数据能力(如JSON解析)而非语义安全对齐。性能与结构化到文本基准测试高度相关(),但与标准越狱鲁棒性几乎无关。2)架构优于规模:模型架构对风险检测性能的影响远大于模型规模,通用型LLM在轨迹分析中始终优于专用安全防御措施。3)时间稳定性:准确率在延长的轨迹中保持稳定。增加的执行步骤使模型能够从静态工具定义转向动态执行行为,实际上在后期阶段提升了风险检测性能。我们的发现表明,保障智能体工作流程需要同时优化结构化推理与安全对齐,以有效缓解中期轨迹风险。
引用
@article{arxiv.2604.07223,
title = {TraceSafe: A Systematic Assessment of LLM Guardrails on Multi-Step Tool-Calling Trajectories},
author = {Yen-Shan Chen and Sian-Yao Huang and Cheng-Lin Yang and Yun-Nung Chen},
journal= {arXiv preprint arXiv:2604.07223},
year = {2026}
}