Herd:利用多个较小 LLM 通过智能编排器匹配专有大型 LLM 的性能
人工智能
2024-09-24 v2
摘要
目前,存在超过一千个多用途且能够执行现实世界任务(包括问答、文本摘要、内容生成等)的 LLM。然而,免费模型的可访问性、规模与可靠性阻碍了它们在日常用例中的广泛部署。为解决访问与规模这两个首要问题,HuggingFace 等组织创建了模型仓库,用户上传了采用不同范式训练的模型权重与量化版本,以及描述其训练过程的模型卡片。虽然部分模型报告了常用基准上的性能,但并非全部如此,且权衡基准性能与模型部署成本对现实世界的影响尚不明晰。在此,我们展示了通过智能路由器,一群开源模型能够匹配或超越专有模型的性能。我们表明,尽管由实际小 2.5 倍的模型组成,Herd 开源模型群能够匹配 ChatGPT 的准确率。我们表明,在 GPT 无法回答查询的情况下,Herd 至少 40% 的时间能够识别出可以回答的模型。
引用
@article{arxiv.2310.19902,
title = {Herd: Using multiple, smaller LLMs to match the performances of proprietary, large LLMs via an intelligent composer},
author = {Surya Narayanan Hari and Rex Liu and Matt Thomson},
journal= {arXiv preprint arXiv:2310.19902},
year = {2024}
}