中文

调度LLM推理的不确定性感知输出长度预测

机器学习 2026-05-26 v2

摘要

为调度LLM推理,最短作业优先(SJF)原则通过优先处理输出长度较短的请求来避免队头阻塞(HOL blocking)。现有方法通常为每个请求预测单一输出长度以辅助调度。我们认为这种点估计与LLM推理的随机解码过程不匹配,因为输出长度本质上是不确定的,由何时采样到序列结束(EOS)标记决定。因此,每个请求的输出长度应以分布而非单一值来拟合。通过对经验数据和随机解码过程的深入分析,我们观察到输出长度服从重尾分布,并可用对数t分布来拟合。基于此,我们提出一个简单度量——尾部膨胀期望(TIE),用于替代SJF调度中的输出长度,它通过对数t分布的期望值结合其尾部概率来调整,以考虑请求生成长输出的风险。为评估我们的TIE调度器,我们与三个强基线进行了比较,结果表明TIE将在线推理的逐token延迟降低了2.31倍,并将离线数据生成的吞吐量提高了1.42倍。

关键词

引用

@article{arxiv.2604.00499,
  title  = {Scheduling LLM Inference with Uncertainty-Aware Output Length Predictions},
  author = {Haoyu Zheng and Yongqiang Zhang and Fangcheng Fu and Xiaokai Zhou and Hao Luo and Hongchao Zhu and Yuanyuan Zhu and Hao Wang and Xiao Yan and Jiawei Jiang},
  journal= {arXiv preprint arXiv:2604.00499},
  year   = {2026}
}

备注

Accepted at ICML 2026