中文

MCP-RADAR:用于评估大语言模型工具使用能力的多维基准

人工智能 2025-10-14 v2

摘要

随着大型语言模型 (Large Language Model, LLM) 从被动文本生成器演变为能够与外部工具交互的主动推理代理,模型上下文协议 (Model Context Protocol, MCP) 正作为动态工具发现和编排的关键标准化框架广泛应行业。尽管MCP已在行业中广泛采用,但现有的评估方法并不充分评估在该新范式下MCP框架内的工具利用能力。为填补这一空白,本文介绍MCP-RADAR,首个专为评估MCP框架内LLM性能而设计的全面基准测试。MCP-RADAR包含一个具有挑战性的数据集,涵盖六个领域:数学推理、网络搜索、邮件、日历、文件管理和终端操作。它基于两个主要准则对性能进行量化:答案正确性和操作准确性。为贴近实际应用,我们的评估采用真实的MCP工具和官方工具的高保真仿真。与依赖主观人类评估或二元成功指标的传统基准测试不同,MCP-RADAR采用跨多个任务领域的客观、可量化测量,包括计算资源效率和成功工具调用轮数的评估。我们评估了领先的封闭源和开源LLM,发现其具有不同的能力轮廓,并揭示了准确性与效率之间显著的权衡。我们的发现为LLM开发者和工具创建者提供了可操作的见解,确立了适用于更广泛LLM代理生态系统的标准化方法。所有实现、配置和数据集均公开于https://anonymous.4open.science/r/MCPRadar-B143。

关键词

引用

@article{arxiv.2505.16700,
  title  = {MCP-RADAR: A Multi-Dimensional Benchmark for Evaluating Tool Use Capabilities in Large Language Models},
  author = {Xuanqi Gao and Siyi Xie and Juan Zhai and Shiqing Ma and Chao Shen},
  journal= {arXiv preprint arXiv:2505.16700},
  year   = {2025}
}