中文

从偏反馈中学习路由 LLM:一策略多取舍

机器学习 2025-10-10 v1

摘要

高效使用大型语言模型(LLM)对于大规模部署至关重要:若缺乏自适应路由,系统要么为强大模型支付高额费用,要么因使用弱模型而风险性能下降。为每个查询选择合适的 LLM 本质上是一个在线决策问题:不同模型的优势各异,价格波动,且用户对准确率和成本的重视程度不同。然而,大多数路由器是在没有标签的情况下训练的,这在部署时的假设常常不成立,此时只能观察所选模型的结果。我们通过 BaRP(Bandit-feedback Routing with Preferences)方法弥合了这一差距,该方法在训练时遵循与部署相同的部分反馈限制,同时支持可调偏好的推理:运营商可在测试时而无需重新训练地调节性能/成本之间的取舍。该方法将问题表述为基于提示特征和用户偏好向量的情境式偏好问题。我们的 метод在训练期间模拟在线反馈环境,能够针对每个新提示调整路由决策,而非依赖完整的离线监督。广泛的实验表明,我们的方法在多个基准上均显著优于强大的离线路由器,至少提高 12.46%,相对于最大的 LLM 提升至少 2.45%,并能对未见任务实现稳健的泛化。

关键词

引用

@article{arxiv.2510.07429,
  title  = {Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs},
  author = {Wang Wei and Tiankai Yang and Hongjie Chen and Yue Zhao and Franck Dernoncourt and Ryan A. Rossi and Hoda Eldardiry},
  journal= {arXiv preprint arXiv:2510.07429},
  year   = {2025}
}

备注

16 pages, 3 figures