中文

TASTE:基于工具序列演化的任务综合

人工智能 2026-05-28 v1

摘要

随着智能体能力的不断提升,现有基准(如 τ2\tau^2-Bench)正变得日益饱和。然而,构建新的基准任务仍然复杂、昂贵且耗时。此外,标准方法是先编写自然语言场景,再映射到工具序列,这只捕获了代理人练习的狭窄子集。本文通过反转任务构建过程来解决这些问题。我们提出了TASTE:从工具序列演化中综合任务,一种自动生成具有挑战性且覆盖更广工具使用的任务的方法。TASTE利用在LLM评估有效性信号上训练的自适应对比 nn-gram模型。这使得能够抽样出覆盖广泛工具组合的有效工具序列。TASTE随后通过聚类从池中选择代表性序列,将其实例化为完整的基准任务,并通过迭代难度演化进行精炼。使用TASTE,我们构建了 τc\tau^c-Bench,这是三个 τ2\tau^2-Bench 领域的具有挑战性的扩展。我们评估了11个智能体/用户LLM配对,发现几乎饱和 τ2\tau^2-Bench 的模型在我们的任务上表现显著下降(例如,Gemini-3-Flash 从 0.82 ⁣ ⁣ ⁣0.940.82\!\!-\!0.94 下降到 0.28 ⁣ ⁣ ⁣0.610.28\!\!-\!0.61)。除了增加难度,我们生成的任务使代理人必须执行的唯一工具组合数翻了两倍以上。我们的结果表明,现有基准上的高分常常反映了饱和,而非稳健的任务解决能力。通过自动生成具有挑战性和高覆盖性的基准,TASTE实现了对未来智能体的持续、可扩展评估。

关键词

引用

@article{arxiv.2605.28556,
  title  = {A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks},
  author = {Tomer Keren and Nitay Calderon and Asaf Yehudai and Yotam Perlitz and Michal Shmueli-Scheuer and Roi Reichert},
  journal= {arXiv preprint arXiv:2605.28556},
  year   = {2026}
}