中文

MARLIN:面向云数据中心可持续 LLM 推理的多智能体博弈论强化学习

分布式、并行与集群计算 2026-05-14 v1 机器学习

摘要

大型语言模型(LLM)在云端平台上日益普及,推动了基于 AI 的消费者和企业服务的兴起。尤其是 LLM 推理请求在整个 LLM 生命周期能源消耗中占比可达 90%,远超训练能源成本。LLM 推理请求日益增长的 volume 正在增加环境足迹,尤其是碳排放和水耗。为了提高云数据中心环境中 LLM 推理服务的可持续性,我们提出一种新型的多智能体博弈论强化学习框架,称为 MARLIN,以协同优化 LLM 推理相关的时间到第一个标记(TTFT)、碳排放、水耗和能源成本。MARLIN 相对于当前最先进的 LLM 推理管理框架,在 TTFT 降低至少 18%,碳排放降低 33%,水耗降低 43%,能源成本降低 11%。

关键词

引用

@article{arxiv.2605.13496,
  title  = {MARLIN: Multi-Agent Game-Theoretic Reinforcement Learning for Sustainable LLM Inference in Cloud Datacenters},
  author = {H. Moore and S. Qi and D. Milojicic and C. Bash and S. Pasricha},
  journal= {arXiv preprint arXiv:2605.13496},
  year   = {2026}
}