中文

利用强化学习控制集中式多智能体 LLM 系统的性能与预算

计算与语言 2025-11-05 v1

摘要

大语言模型(LLM)在不同领域展现出互补的优势,并伴随着不同的推理成本,这促使了多智能体 LLM 系统的设计,使专业化模型能够高效协作。现有方法主要依赖去中心化框架,对每个输入调用多个 LLM,从而导致大量且不可控的推理成本。在本工作中,我们引入了一个集中式多 LLM 框架,其中控制器 LLM 以成本高效且成本可控的方式选择性地协调一组专家模型。我们将此协调问题表述为具有双重目标的强化学习:在最大化任务性能的同时最小化整体推理成本。此外,我们期望多智能体系统在推理期间能够针对不同的预算条件表现出自适应行为。为此,我们提出了 CoRL,一个在可控多预算设置下优化性能成本权衡的强化学习框架。在四个不同的基准测试上的实验表明,CoRL 使单一系统能够在高预算设置下超越最佳专家 LLM,同时在更经济的低预算模式下保持强劲性能,突显了集中式协调对于可扩展且成本高效的多智能体 LLM 系统的有效性。

关键词

引用

@article{arxiv.2511.02755,
  title  = {Controlling Performance and Budget of a Centralized Multi-agent LLM System with Reinforcement Learning},
  author = {Bowen Jin and TJ Collins and Donghan Yu and Mert Cemri and Shenao Zhang and Mengyu Li and Jay Tang and Tian Qin and Zhiyang Xu and Jiarui Lu and Guoli Yin and Jiawei Han and Zirui Wang},
  journal= {arXiv preprint arXiv:2511.02755},
  year   = {2025}
}

备注

14 pages