SkillsBench:衡量 Agent 技能在多样任务中的表现的基准
人工智能
2026-03-16 v3
摘要
Agent 技能是增强 LLM 代理在推理时使用的结构化程序知识包。尽管该技术正在得到快速采纳,但没有标准方法来衡量它们是否实际上有帮助。我们提出 SkillsBench,这是一个包含 86 个跨 11 个领域的任务基准,配有精选技能和确定性验证器。每个任务在三种条件下进行评估:无技能、精选技能和自生成技能。我们测试了 7 种代理-模型配置,涵盖 7,308 条轨迹。精选技能将平均通过率提高 16.2 个百分点,但效果在不同领域之间差异很大(从软件工程 +4.5pp 到医疗保健 +51.9pp),且 16 个 84 个任务显示出负向差值。自生成技能平均没有任何好处,表明模型无法可靠地生成其从事有益消耗所需的程序知识。具有 2-3 个模块的聚焦技能超过全面文档,而带有技能的小型模型可以与不带技能的大型模型相当。
引用
@article{arxiv.2602.12670,
title = {SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks},
author = {Xiangyi Li and Wenbo Chen and Yimin Liu and Shenghan Zheng and Xiaokun Chen and Yifeng He and Yubo Li and Bingran You and Haotian Shen and Jiankai Sun and Shuyi Wang and Binxu Li and Qunhong Zeng and Di Wang and Xuandong Zhao and Yuanli Wang and Roey Ben Chaim and Zonglin Di and Yipeng Gao and Junwei He and Yizhuo He and Liqiang Jing and Luyang Kong and Xin Lan and Jiachen Li and Songlin Li and Yijiang Li and Yueqian Lin and Xinyi Liu and Xuanqing Liu and Haoran Lyu and Ze Ma and Bowei Wang and Runhui Wang and Tianyu Wang and Wengao Ye and Yue Zhang and Hanwen Xing and Yiqi Xue and Steven Dillmann and Han-chung Lee},
journal= {arXiv preprint arXiv:2602.12670},
year = {2026}
}