基于神经 bandit 的 LLM 次任务最优选择
计算与语言
2026-04-23 v3 机器学习
摘要
随着大型语言模型(LLMs)日益流行,日益增长的需求是预测在给定查询时,哪一个 LLM 集合中的哪一个会以低成本提供成功答案。这一问题将变得even更相关,因为 LLM 代理被要求解决越来越多的“agentic” AI 任务。这些任务常被划分为更小的子任务,然后可以由预期在特定子任务上表现良好的 LLM 执行。例如,要从医学记录中提取诊断,可首先选择 LLM 来总结记录,再选择另一个 LLM 来验证概述,然后选择可能的不同 LLM 从概述中提取诊断。与现有的 LLM 选择或路由算法不同,这一设置需要选择一系列 LLM,每个 LLM 的输出都会输入到下一个 LLM,可能影响其成功率。因此,与单个 LLM 选择不同,每个子任务输出的质量直接影响输入,从而影响下游 LLM 的成本和成功率,创建复杂的性能依赖关系,必须在选择过程中学习。我们提出一种基于神经情境 bandit 的算法,该算法在不要求历史 LLM 性能数据的情况下训练神经网络以指导 LLM 选择用于不同子任务的 LLM。我们证明,我们提出的 Sequential Bandits 算法在任务数量上实现亚线性后悔,我们在两个真实数据集上实验验证了其优于其他 LLM 选择算法的优越性能。
引用
@article{arxiv.2508.09958,
title = {Neural Bandit Based Optimal LLM Selection for a Pipeline of Subtasks},
author = {Baran Atalar and Eddie Zhang and Carlee Joe-Wong},
journal= {arXiv preprint arXiv:2508.09958},
year = {2026}
}