重新思考模型上下文协议增强型大语言模型:帮助还是障碍?
人工智能
2025-08-19 v1
摘要
模型上下文协议(MCP)使大语言模型(LLM)能够按需访问外部资源。虽然常被假设为提升性能,但LLM实际如何利用这一能力仍鲜有了解。我们引入MCPGAUGE,这是首个系统化评估框架,用于探讨LLM-MCP交互的四个关键维度:主动性(自发工具使用)、遵从性(遵循工具使用指令)、有效性(集成后任务性能)以及开销(所致计算成本)。MCPGAUGE包含160个提示语和25个数据集,涵盖知识理解、常规推理和代码生成。我们的大规模评估覆盖六个商业LLM、30个MCP工具套件以及单轮和双轮交互场景,约20,000次API调用和超6,000美元的计算成本。这一全面研究揭示了四项关键发现,挑战了关于MCP集成有效性的既有假设。这些见解凸显当前AI工具集成的关键局限性,并将MCPGAUGE定位为推进可控、工具增强型LLM的原则性基准。
引用
@article{arxiv.2508.12566,
title = {Help or Hurdle? Rethinking Model Context Protocol-Augmented Large Language Models},
author = {Wei Song and Haonan Zhong and Ziqi Ding and Jingling Xue and Yuekang Li},
journal= {arXiv preprint arXiv:2508.12566},
year = {2025}
}