中文

同一模型是否不是同一服务?面向托管开源 LLM API 的测量研究

性能 2026-05-08 v3

摘要

开源大型语言模型 (LLM) 通常被命名为模型实体,但生产用户常将其作为托管 API 服务消耗。本文认为 operational unit是 service 对象:由模型变体、协议行为、上下文容量、列出价格、延迟和吞吐分布、可靠性以及任务可行性等定义的、由提供商特定、随时间变化的端点。我们使用采样请求日志、提供商元数据、兼容性探针、定价快照以及由 AI Ping 在 2025 年第四季度收集的持续延迟测量,研究了该 service 层次如何改变"同一模型"的含义。首先,观察到的需求在版本间集中但持久:在显示的 family aggregate 中,最大 family 承载 32.0% 的相对需求,前五大 family 承载 87.4%,基尼系数为 0.693,而旧版本在新版本发布后仍保持活跃。其次,供应与使用分离:提供商列出的广度并不必然意味着实际采纳,列出的价格比延迟、吞吐、上下文长度、协议支持和错误语义更稳固。第三,任务混合 matters:应用程序诱导不同的 token 长度场景,因此提供商选择是在提供商-模型-任务-时间元组上受约束的决策,而非仅凭模型名称进行查找。在两个具有观察到的可行性约束的代表性反事实情形中,路由可将 Qwen3-32B 的成本降低 37.8%,并将 DeepSeek-V3.2 的平均吞吐提升约 90%,相对于直接访问官方渠道。结果支持将托管开源 LLM 视为异构服务,而非静态目录条目的测量观点。我们开源了测量方法及再现 artifacts,地址为 https://github.com/haoruilee/llm_api_measurement_study,以支持结果再现。

关键词

引用

@article{arxiv.2605.02821,
  title  = {When Is the Same Model Not the Same Service? A Measurement Study of Hosted Open-Weight LLM APIs},
  author = {Haorui Li and Zhenghui He and Xuanzi Liu and Yang Xu and Dongsheng Liu and Jiakang Ma and Lupan Wu and Yangjie Wu and Xiongchao Tang and Tianhui Shi},
  journal= {arXiv preprint arXiv:2605.02821},
  year   = {2026}
}

备注

25 pages, 21 figures; substantially revised abstract, add open-sourced code repo