TensorOpera Router:高效 LLM 推理的多模型路由器
人工智能
2024-10-25 v3 机器学习
摘要
随着大型语言模型(LLM)在各个领域的快速增长,众多新的 LLM 陆续涌现,每个模型都具备特定领域的专业知识。这一现象凸显了对快速、高质量且成本效益佳的 LLM 查询响应方法的需求。然而,目前不存在单一的 LLM 能够有效平衡这一三难困局。一些模型功能强大但极其昂贵,而另一些模型则运行快速且成本低廉,但在质量方面存在不足。为解决这一挑战,我们提出了 TO-Router,一种非单体化的 LLM 查询系统,该系统 seamlessly 将各种 LLM 专家集成到单个查询界面,并根据查询的具体需求动态地将 incoming 查询路由到最高性能的专家。通过大量实验,我们展示了与各个独立专家模型相比,TO-Router 在查询效率上提升了最高可达 40%,在成本上实现了最高可达 30% 的显著降低,同时在性能上保持或提升了最高可达 10%。
引用
@article{arxiv.2408.12320,
title = {TensorOpera Router: A Multi-Model Router for Efficient LLM Inference},
author = {Dimitris Stripelis and Zijian Hu and Jipeng Zhang and Zhaozhuo Xu and Alay Dilipbhai Shah and Han Jin and Yuhang Yao and Salman Avestimehr and Chaoyang He},
journal= {arXiv preprint arXiv:2408.12320},
year = {2024}
}
备注
14 pages, 7 figures, 2 tables