中文

当技能无济于事:关于进攻性网络安全中工具驱动智能体程序性知识的负面结果

人工智能 2026-05-26 v2 多智能体系统

摘要

智能体技能,即在推理时加载到大语言模型智能体中的结构化程序性知识包,被广泛报道可在不同领域将任务通过率平均提高16.2个百分点。然而,相同的基准测试显示出巨大差异,在84个任务中,有16个在引入技能后出现了负增量。社区尚未明确阐述技能何时有帮助、何时仅是冗余开销的清晰机制。我们重新分析了一项最近发表的、针对一个基于MCP的自主夺旗赛智能体在四种信息丰富度递增的文档条件下(591、12865、17253和36001个词元)进行的180次运行受控研究,并表明这些条件几乎完全对应于无技能、经验技能、精选技能和综合技能的消融。在进攻性网络安全这一现有技能基准未深入覆盖的领域中,技能的边际效益崩溃了。无技能与全技能条件之间的差距仅为8.9个百分点(p=0.71p = 0.71χ2\chi^2p=0.25p = 0.25,Cochran–Armitage趋势检验;六个成对Cohen's hh值中有五个低于0.20.2的小效应阈值)。我们认为,缺失的变量是环境反馈带宽。当智能体的工具层返回严格的、模式验证的、低延迟的观察结果时,环境本身提供了通常需要技能来提供的程序性校正信号。因此,精心策划的技能的边际效益大幅降低,并且在某些情况下(例如,我们的时序侧信道设置),甚至会主动降低性能。我们阐述了一个可证伪的假设,概述了其对复合人工智能系统的设计启示,并将发布重新分析流程以支持复现。

关键词

引用

@article{arxiv.2605.20023,
  title  = {When Skills Don't Help: A Negative Result on Procedural Knowledge for Tool-Grounded Agents in Offensive Cybersecurity},
  author = {Samuel Jacob Chacko and James Hugglestone and Chashi Mahiul Islam and Xiuwen Liu},
  journal= {arXiv preprint arXiv:2605.20023},
  year   = {2026}
}

备注

Accepted as a poster at ACM CAIS 2026 AgentSkills Workshop