中文

MCP-Universe:使用真实世界模型上下文协议服务器评测大语言模型

人工智能 2025-08-21 v1 计算与语言

摘要

模型上下文协议已成为连接大语言模型与外部数据源和工具的变革性标准,在主要AI提供商和开发平台中迅速获得采用。然而,现有的基准测试过于简单,未能捕捉到真实应用挑战,如长程推理和庞大、陌生的工具空间。为解决这一关键差距,我们引入了MCP-Universe,这是第一个专门设计用于通过与真实世界MCP服务器交互,在现实且困难的任务中评估LLM的综合基准测试。我们的基准测试涵盖6个核心领域,横跨11个不同的MCP服务器:位置导航、仓库管理、金融分析、3D设计、浏览器自动化和网页搜索。为确保严格评估,我们实现了基于执行的评估器,包括用于代理格式合规性的格式评估器、用于时不变内容匹配的静态评估器,以及自动检索时间敏感任务实时真实值的动态评估器。通过对领先LLM的广泛评估,我们发现即使是GPT-5(43.72%)、Grok-4(33.33%)和Claude-4.0-Sonnet(29.44%)等SOTA模型也表现出显著的性能限制。此外,我们的基准测试对LLM代理构成了显著的长上下文挑战,因为输入令牌的数量随着交互步数的增加而迅速增长。而且,它引入了未知工具挑战,因为LLM代理通常不熟悉MCP服务器的精确用法。值得注意的是,像Cursor这样的企业级代理无法获得比标准ReAct框架更好的性能。除了评估之外,我们还开源了带有UI支持的可扩展评估框架,使研究人员和从业者能够无缝集成新的代理和MCP服务器,同时促进快速发展的MCP生态系统中的创新。

关键词

引用

@article{arxiv.2508.14704,
  title  = {MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers},
  author = {Ziyang Luo and Zhiqi Shen and Wenzhuo Yang and Zirui Zhao and Prathyusha Jwalapuram and Amrita Saha and Doyen Sahoo and Silvio Savarese and Caiming Xiong and Junnan Li},
  journal= {arXiv preprint arXiv:2508.14704},
  year   = {2025}
}

备注

Website: https://mcp-universe.github.io