TASTE:基于工具序列演化的任务综合
人工智能
2026-05-28 v1
摘要
随着智能体能力的不断提升,现有基准(如 -Bench)正变得日益饱和。然而,构建新的基准任务仍然复杂、昂贵且耗时。此外,标准方法是先编写自然语言场景,再映射到工具序列,这只捕获了代理人练习的狭窄子集。本文通过反转任务构建过程来解决这些问题。我们提出了TASTE:从工具序列演化中综合任务,一种自动生成具有挑战性且覆盖更广工具使用的任务的方法。TASTE利用在LLM评估有效性信号上训练的自适应对比 -gram模型。这使得能够抽样出覆盖广泛工具组合的有效工具序列。TASTE随后通过聚类从池中选择代表性序列,将其实例化为完整的基准任务,并通过迭代难度演化进行精炼。使用TASTE,我们构建了 -Bench,这是三个 -Bench 领域的具有挑战性的扩展。我们评估了11个智能体/用户LLM配对,发现几乎饱和 -Bench 的模型在我们的任务上表现显著下降(例如,Gemini-3-Flash 从 下降到 )。除了增加难度,我们生成的任务使代理人必须执行的唯一工具组合数翻了两倍以上。我们的结果表明,现有基准上的高分常常反映了饱和,而非稳健的任务解决能力。通过自动生成具有挑战性和高覆盖性的基准,TASTE实现了对未来智能体的持续、可扩展评估。
关键词
引用
@article{arxiv.2605.28556,
title = {A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks},
author = {Tomer Keren and Nitay Calderon and Asaf Yehudai and Yotam Perlitz and Michal Shmueli-Scheuer and Roi Reichert},
journal= {arXiv preprint arXiv:2605.28556},
year = {2026}
}