中文

注意GAP:LLM智能体中文本安全性无法迁移至工具调用安全性

人工智能 2026-02-20 v1 软件工程

摘要

作为智能体部署的大型语言模型越来越多地通过工具调用与外部系统交互——这些操作具有文本输出本身所不具备的现实世界后果。然而,安全性评估主要衡量文本层面的拒绝行为,留下了一个关键问题未解:抑制有害文本的对齐是否也能抑制有害行为?我们引入了GAP基准,这是一个系统性的评估框架,用于衡量LLM智能体中文本层面安全性与工具调用层面安全性之间的差异。我们测试了六个前沿模型,涵盖六个受监管领域(制药、金融、教育、就业、法律和基础设施),每个领域有七种越狱场景、三种系统提示条件(中性、安全强化和工具鼓励)以及两种提示变体,生成了17,420个可供分析的数据点。我们的核心发现是,文本安全性无法迁移至工具调用安全性。在所有六个模型中,我们都观察到模型文本输出拒绝有害请求,而其工具调用同时执行被禁止操作的情况——我们将这种差异形式化为GAP指标。即使在安全强化的系统提示下,所有六个模型中仍存在219个此类案例。系统提示措辞对工具调用行为有显著影响:最稳健模型的TC安全率跨度为21个百分点,而对提示最敏感的模型则为57个百分点,在Bonferroni校正后,18对消融比较中有16对仍然显著。运行时治理契约在所有六个模型中减少了信息泄露,但对其本身被禁止的工具调用尝试没有产生可检测的威慑效果。这些结果表明,仅文本的安全性评估不足以评估智能体行为,工具调用安全性需要专门的测量和缓解措施。

关键词

引用

@article{arxiv.2602.16943,
  title  = {Mind the GAP: Text Safety Does Not Transfer to Tool-Call Safety in LLM Agents},
  author = {Arnold Cartagena and Ariane Teixeira},
  journal= {arXiv preprint arXiv:2602.16943},
  year   = {2026}
}

备注

23 pages, 5 figures, 4 tables, code and data at https://github.com/acartag7/gap-benchmark