MCP 与 RAG 与 NLWeb 与 HTML:面向 Web 代理的不同接口有效性与效率比较(技术报告)
计算与语言
2026-04-22 v1
摘要
大型语言模型代理日益用于自动化执行 web 任务,如产品搜索、报价比较和结账。当前研究探索了这些代理与网站交互的不同接口,包括通过传统 HTML 浏览、检索增强生成 (RAG) 用于预抓取内容、通过模型上下文协议 (MCP) 使用 Web API 进行通信,以及通过 NLWeb 接口进行自然语言查询。然而,尚无任何前期工作在单一受控环境中使用相同任务对这四种架构进行比较。为填补这一空白,我们引入了一个由四个模拟电商店组成的 testbed,每个店都通过 HTML、MCP 和 NLWeb 接口提供其产品。对于每个接口 (HTML、RAG、MCP 和 NLWeb),我们开发了专门的代理,执行相同的任务集合,任务范围从简单的产品搜索和价格比较到复杂的查询寻找互补或替代产品以及结账过程。我们使用 GPT-4.1、GPT-5、GPT-5 mini 和 Claude Sonnet 4 作为底层 LLM 进行评估。我们的评估表明,RAG、MCP 和 NLWeb 代理在有效性和效率上均优于 HTML。在所有任务上平均而言,HTML 的 F1 分数为 0.67,而其他三种方法的 F1 分数介于 0.75 与 0.77 之间。Token 使用量从 HTML 的约 24.1k 降至其他方法 47k 至 140k 之间。每个任务的运行时间从 291 秒降至 50 至 62 秒之间。最佳总体配置为使用 GPT-5 的 RAG, achieving F1 分数 0.87,完成率 0.79。也考虑成本,RAG 与 GPT-5 mini 在 API 使用费和性能之间提供了良好的折中。我们的实验表明,交互接口的选择对 LLM 基于 web 代理的有效性和效率具有显著影响。
引用
@article{arxiv.2511.23281,
title = {MCP vs RAG vs NLWeb vs HTML: A Comparison of the Effectiveness and Efficiency of Different Agent Interfaces to the Web (Technical Report)},
author = {Aaron Steiner and Ralph Peeters and Christian Bizer},
journal= {arXiv preprint arXiv:2511.23281},
year = {2026}
}