中文

LLM Bandit: 基于偏好条件的动态路由成本效益高的LLM生成

机器学习 2025-02-06 v1

摘要

大语言模型(LLM)的快速发展带来了能力各异、在不同任务和领域中表现卓越的众多模型。然而,为用户查询选择最优LLM常常面临准确性与成本之间的艰难权衡,这种困难因个体查询的多样化需求而加剧。本文提出了一种新框架,将LLM选择过程形式化为多臂老虎机问题,使查询能够动态且智能地路由到最合适的模型。我们的ethods 采用偏好条件的动态路由机制,允许用户在推理时指定其偏好,从而在性能和成本之间提供可定制的平衡。此外,我们的选择策略设计为可推广至未见LLM,确保对新出现的模型具有适应性。实验结果表明,我们的方法在 various LLM平台 上实现了准确性和成本效益的显著提升,展示了该框架在实际场景中自适应优化LLM选择的潜力。

关键词

引用

@article{arxiv.2502.02743,
  title  = {LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing},
  author = {Yang Li},
  journal= {arXiv preprint arXiv:2502.02743},
  year   = {2025}
}