中文

基于多功能奖励模型的成本效益在线多LLM选择

机器学习 2024-10-03 v2 人工智能 人机交互

摘要

随着大型语言模型(LLM)的快速发展,多LLM任务的多样性及其定价结构的可变性变得日益重要,因为不同LLM之间的成本可能差异巨大。为了应对这些挑战,我们引入了\textit{C2MAB-V},一种用于最优LLM选择和使用的\textit{成本效益组合多臂老虎机与多功能奖励模型}。这种在线模型不同于传统的静态方法或那些依赖单一LLM而不考虑成本的方法。在调度云上部署多个LLM,并由本地服务器专门处理用户查询的情况下,\textit{C2MAB-V}促进了在组合搜索空间中选择多个LLM,特别适用于具有不同奖励模型的各种协作任务类型。基于我们设计的在线反馈机制和置信界技术,\textit{C2MAB-V}可以通过管理不同模型间的探索-利用权衡,同时平衡不同任务的成本和奖励,有效地应对多LLM选择挑战。针对选择多个LLM时面临权衡困境的NP难整数线性规划问题,我们的解决方法是:i) 由本地服务器将整数问题分解为松弛形式,ii) 利用调度云提供的离散化舍入方案来获得最优LLM组合,以及iii) 基于反馈进行持续的在线更新。理论上,我们证明了\textit{C2MAB-V}为多功能奖励模型提供了严格的保证,在某些退化情况下匹配了遗憾和违规的最新结果。实验上,我们展示了\textit{C2MAB-V}在三个应用场景中使用九个LLM有效地平衡了性能和成本效益。

关键词

引用

@article{arxiv.2405.16587,
  title  = {Cost-Effective Online Multi-LLM Selection with Versatile Reward Models},
  author = {Xiangxiang Dai and Jin Li and Xutong Liu and Anqi Yu and John C. S. Lui},
  journal= {arXiv preprint arXiv:2405.16587},
  year   = {2024}
}

备注

32 pages, 14 figures, conference