RouteNLP:基于共轃级联和蒸馊共优化的闭环 LLM 路由
计算与语言
2026-04-28 v1 机器学习
摘要
服务多样化的 NLP 工作负载需要大型语言模型,成本高昂:在一个企业合作伙伴处,推理成本甚至超过 20 万美元/月,尽管超过 70% 的查询是常规任务,完全可以在较小模型中处理。我们提出 RouteNLP,一个闭环框架,在满足每个任务质量约束的同时,将查询在分层模型组合中路由,以最小化成本。该框架集成了三个组件:一个基于难易度的路由器,使用共享任务条件表示在偏好数据和质量信号上进行训练;置信度校准的级联,利用共轃预测进行分布自由的阈值初始化;蒸馊-路由共优化循环,对升级失败进行聚类,对更便宜的模型应用针对性知识蒸馈,并自动重新训练路由器,实现的成本改进是非针对性蒸馈的两倍。在一个为企业客户服务部门进行的 8 周试点部署中,处理约每天 5000 个查询,RouteNLP 将推理成本降低 58%,保持 91% 的响应接受率,将 p99 延迟从 1847 毫秒缩短至 387 毫秒。在覆盖金融、客户服务和法律领域的六个任务基准测试中,该框架实现了 40-85% 的成本降低,同时在结构化任务上保持 96-100% 的质量,在生成任务上保持 96-98% 的质量,人类评估确认 74.5% 的路由生成输出与前沿模型质量相当或更优。
引用
@article{arxiv.2604.23577,
title = {RouteNLP: Closed-Loop LLM Routing with Conformal Cascading and Distillation Co-Optimization},
author = {Dongxin Guo and Jikun Wu and Siu Ming Yiu},
journal= {arXiv preprint arXiv:2604.23577},
year = {2026}
}
备注
Accepted at ACL 2026 Industry Track. 13 pages, 2 figures, 15 tables, 1 algorithm