选择哪个 LLM?基于时间递增多臂老虎机的收敛感知在线模型选择
机器学习
2024-03-13 v1 机器学习
摘要
随着大语言模型 (LLM) 的采用激增,基于网络的应用(如聊天机器人、搜索引擎和新闻推荐)在规模和复杂性上持续增长。因此,由于需要在多样化的模型集中选择最佳模型,同时平衡任务奖励与探索成本,在线模型选择受到了越来越多的关注。组织面临着诸如是否采用昂贵的基于 API 的 LLM 还是本地微调的小型 LLM 等决策,需要权衡成本与性能。传统的选择方法通常在选择一个模型之前评估每个候选模型,鉴于 LLM 训练和微调成本的上升,这种方法变得不再可行。此外,将过多资源分配给探索表现不佳的模型也是不可取的。虽然最近的一些工作利用在线多臂老虎机 (bandit) 算法来管理模型选择中的这种探索 - 利用权衡,但它们往往忽略了模型在迭代微调过程中性能先增后收敛的趋势,导致预测不准确和模型选择次优。在本文中,我们提出了一种时间递增多臂老虎机算法 TI-UCB,它能有效预测因微调导致的模型性能提升,并在模型选择中高效平衡探索与利用。为了进一步捕捉模型的收敛点,我们通过比较连续的增量预测开发了一种变化检测机制。我们从理论上证明了我们的算法在典型的递增老虎机设置中实现了对数遗憾上界,这意味着快速的收敛速率。通过对分类模型选择和 LLM 在线选择的广泛实验,也在经验上验证了我们方法的优势。我们的结果突显了利用先增后收敛模式对于 LLM 部署中更高效、更经济的模型选择的重要性。
引用
@article{arxiv.2403.07213,
title = {Which LLM to Play? Convergence-Aware Online Model Selection with Time-Increasing Bandits},
author = {Yu Xia and Fang Kong and Tong Yu and Liya Guo and Ryan A. Rossi and Sungchul Kim and Shuai Li},
journal= {arXiv preprint arXiv:2403.07213},
year = {2024}
}
备注
Accepted by WWW'24 (Oral)