中文

ToolSafe:通过主动的步骤级护栏和反馈增强基于LLM的代理的工具调用安全性

计算与语言 2026-01-16 v1

摘要

虽然基于LLM的代理可以通过调用外部工具与环境交互,但其扩展的能力也放大了安全风险。实时监控步骤级的工具调用行为并在不安全执行之前主动干预对于代理部署至关重要,但这一点仍未得到充分探索。在这项工作中,我们首先构建了TS-Bench,一个用于LLM代理中步骤级工具调用安全检测的新型基准。然后,我们使用多任务强化学习开发了一个护栏模型TS-Guard。该模型通过推理交互历史,在执行前主动检测不安全的工具调用动作。它评估请求的有害性和动作-攻击相关性,产生可解释且可泛化的安全判断和反馈。此外,我们引入了TS-Flow,一个用于LLM代理的、由护栏反馈驱动的推理框架,在提示注入攻击下,平均将ReAct风格代理的有害工具调用减少了65%,并将良性任务完成率提高了约10%。

关键词

引用

@article{arxiv.2601.10156,
  title  = {ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback},
  author = {Yutao Mou and Zhangchi Xue and Lijun Li and Peiyang Liu and Shikun Zhang and Wei Ye and Jing Shao},
  journal= {arXiv preprint arXiv:2601.10156},
  year   = {2026}
}

备注

Work in Progress. Code available: https://github.com/MurrayTom/ToolSafe