中文

CONCUR:基于阻塞的并发控制实现 LLM 的高吞吐代理批处理推理

分布式、并行与集群计算 2026-02-02 v1

摘要

代理工作负载的批处理推理对 GPU 键值 (KV) 缓存施加持续和累积性压力,常在内存容量耗尽之前导致严重的吞吐量下降。我们识别了这一现象为中期抖动(middle-phase thrashing),这是一种此前缺乏关注的病态情况,其中缓存效率随着长期代理累积状态而崩溃。我们认为,缓解这一病态现象需要超越反应式、请求级缓存管理,转向主动的、代理级入量控制。drawing inspiration from 分布式系统中的阻塞控制,我们将 KV 缓存视为取决于反馈驱动调节的共享资源,其高效利用取决于反馈驱动的调节。基于这一洞见,我们提出 CONCUR,一个轻量级控制层,用于调节代理入量以限制总体缓存压力,同时保持执行连续性。CONCUR 采用 cache-aware 控制算法动态调整活跃代理数量,依据运行时缓存信号。 在大型模型和真实世界代理工作负载上,CONCUR 防止了中期抖动,并在 Qwen3-32B 上实现吞吐量提升最高可达 4.09 倍,在 DeepSeek-V3 上实现 1.9 倍提升,同时与现有 LLM 推理系统兼容。

关键词

引用

@article{arxiv.2601.22705,
  title  = {CONCUR: High-Throughput Agentic Batch Inference of LLM via Congestion-Based Concurrency Control},
  author = {Qiaoling Chen and Zhisheng Ye and Tian Tang and Peng Sun and Boyu Tian and Guoteng Wang and Shenggui Li and Yonggang Wen and Zhenhua Han and Tianwei Zhang},
  journal= {arXiv preprint arXiv:2601.22705},
  year   = {2026}
}