中文

面向LLM服务器中准确率-延迟权衡的推理令牌排队感知优化

机器学习 2026-01-16 v1 人工智能 信息论 网络与互联网体系结构 math.IT 最优化与控制

摘要

我们考虑一个服务于属于NN个不同任务类型的异构查询流的大型语言模型(LLM)服务器。查询按照泊松过程到达,每种类型以已知的先验概率出现。对于每种任务类型,服务器分配固定数量的内部思考令牌,这决定了该查询的计算工作量。令牌分配引入了准确率-延迟权衡:服务时间遵循分配的令牌的近似仿射函数,而正确响应的概率呈现递减收益。在先入先出(FIFO)服务规则下,系统作为M/G/1M/G/1队列运行,平均系统时间取决于所得服务时间分布的一阶和二阶矩。我们制定了一个约束优化问题,该问题在架构令牌预算约束和队列稳定性条件下,最大化由平均系统时间惩罚的加权平均准确率目标。目标函数在稳定区域上被证明是严格凹的,这确保了最优令牌分配的存在性和唯一性。一阶最优性条件产生了最优解的耦合投影不动点特征,以及一个迭代解和一个显式的充分收缩条件。此外,开发了一种具有可计算全局步长边界的投影梯度方法,以保证在收缩区域之外的收敛。最后,通过对连续解进行舍入获得整数值令牌分配,并在仿真结果中评估了由此产生的性能损失。

关键词

引用

@article{arxiv.2601.10274,
  title  = {Queueing-Aware Optimization of Reasoning Tokens for Accuracy-Latency Trade-offs in LLM Servers},
  author = {Emre Ozbas and Melih Bastopcu},
  journal= {arXiv preprint arXiv:2601.10274},
  year   = {2026}
}