GAR:通过约束优化实现大语言模型推理的碳感知路由
人工智能
2026-05-13 v1
摘要
大型语言模型(LLM)的日益部署使得按请求路由对于在异构模型池中平衡响应质量和计算成本至关重要。当前的路由方法很少将可持续能源使用和二氧化碳排放作为优化目标,尽管电网碳强度因时间和地区而异,且模型在能耗上差异显著。为填补这一空白,我们引入了绿色感知路由(GAR),这是一个约束多目标优化框架,旨在在明确的准确率下限和 P95 延迟服务水平目标(SLO)约束下,最小化每个请求的二氧化碳排放。GAR 通过每个数据集的下限调整采用自适应约束优化,并集成了用于正确性、尾部延迟和碳排放的轻量级估计器,从而无需额外的推理过程即可实现实时路由决策。我们提出了 GAR-PD,一种用于滚动碳预算的实用在线原始-对偶路由算法,以及实现高可行性覆盖同时限制准确率下降的启发式变体。在标准 NLP 基准上使用异构 LLM 池(7B-70B)进行的综合实验表明,GAR 在保持有竞争力的准确率和 P95 延迟保证的同时,实现了显著的碳减排,为可持续的 LLM 推理提供了一种实用的、有理论依据的方法。
引用
@article{arxiv.2605.11603,
title = {GAR: Carbon-Aware Routing for LLM Inference via Constrained Optimization},
author = {Disha Sheshanarayana and Rajat Subhra Pal and Manjira Sinha and Tirthankar Dasgupta},
journal= {arXiv preprint arXiv:2605.11603},
year = {2026}
}