中文

AgentSearchBench:野外 AI 代理搜索基准

人工智能 2026-04-27 v1 信息检索 多智能体系统

摘要

AI 代理生态系统的快速增长正在改变复杂任务的委派与执行方式,创造了一种新的挑战,即为给定任务识别合适的代理。与传统工具不同,代理能力往往是组合式的且依赖于执行情况,这使得仅从文本描述来评估代理能力变得困难。然而,现有的研究和基准通常假设功能明确、候选池受控或仅可执行任务查询,导致对真实世界代理搜索情景的研究不足。我们引入 AgentSearchBench,这是一个来自多个提供商近 10,000 个真实世界代理的大规模基准,用于野外代理搜索。该基准将代理搜索形式化为检索和重排序问题,分别针对可执行任务查询和高层次任务描述,并使用执行 grounding 的绩效信号进行相关性评估。实验揭示了语义相似性与实际代理性能之间的持续差距,暴露了基于描述的检索和重排序方法的局限性。我们进一步表明,轻量级行为信号,包括执行感知探针,可显著提高排序质量,凸显将执行信号纳入代理发现的重要性。我们的代码已公开于 https://github.com/Bingo-W/AgentSearchBench。

关键词

引用

@article{arxiv.2604.22436,
  title  = {AgentSearchBench: A Benchmark for AI Agent Search in the Wild},
  author = {Bin Wu and Arastun Mammadli and Xiaoyu Zhang and Emine Yilmaz},
  journal= {arXiv preprint arXiv:2604.22436},
  year   = {2026}
}