从文档到描述:面向 MCP 服务器描述的嗅味感知评估
软件工程
2026-02-24 v1
摘要
模型上下文协议(MCP)已迅速成为连接基于 LLM 的智能体与外部工具通过可重用 MCP 服务器的事实标准。在实际应用中,服务器选择和接入依赖大量自由文本工具描述,而这些描述意图上具有宽松约束。尽管这种灵活性在很大程度上确保了 MCP 服务器的可扩展性,但也制造了一个可靠性差距——描述常常误表或遗漏关键语义,增加试错集成,降低智能体行为,甚至可能引入安全风险。为此,我们提出首个系统性研究,探讨 MCP 工具描述中嗅味(smell)及其对可用性的影响。具体而言,我们综合了软件/API 文档实践和智能体工具使用要求,构建四维质量标准:准确性、功能性、信息完整性和简洁性,覆盖 18 个具体嗅味类别。使用该标准,我们对 10,831 个 MCP 服务器进行大规模实证研究。我们发现描述嗅味普遍存在(例如 73% 的工具名称重复,数千个参数语义错误或缺失返回描述),反映出一种“代码优先、描述为后”模式。通过控制性的突变基准研究,我们表明这些嗅味显著影响 LLM 工具选择,其中功能性和准确性的影响最大(分别提升 +11.6% 和 +8.8%,p < 0.001)。在功能等效的服务器中,标准合规的描述可达 72% 的选中概率(相对于 20% 基准提升 260%),表明基于嗅味的修复在实际应用中具有显著效益。我们发布了标注数据集和标准,以支持未来可靠和安全的 MCP 生态系统的工作。
引用
@article{arxiv.2602.18914,
title = {From Docs to Descriptions: Smell-Aware Evaluation of MCP Server Descriptions},
author = {Peiran Wang and Ying Li and Yuqiang Sun and Chengwei Liu and Yang Liu and Yuan Tian},
journal= {arXiv preprint arXiv:2602.18914},
year = {2026}
}