Distributed, Parallel, and Cluster Computing · Computer Science
GoodServe: Towards High-Goodput Serving of Agentic LLM Inferences over Heterogeneous Resources
Boxiao Du, Boning Huangfu, Yizhou Luo, Chen Chen +4
2026-05-19
Distributed, Parallel, and Cluster Computing · Computer Science
DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving
Yinmin Zhong, Shengyu Liu, Junda Chen, Jianbo Hu +4
2024-06-07
Distributed, Parallel, and Cluster Computing · Computer Science
A System for Microserving of LLMs
Hongyi Jin, Ruihang Lai, Charlie F. Ruan, Yingcheng Wang +4
2024-12-18
Distributed, Parallel, and Cluster Computing · Computer Science
DynaServe: Unified and Elastic Execution for Dynamic Disaggregated LLM Serving
Chaoyi Ruan, Yinhe Chen, Dongqi Tian, Yandong Shi +3
2025-05-23
Distributed, Parallel, and Cluster Computing · Computer Science
MuxServe: Flexible Spatial-Temporal Multiplexing for Multiple LLM Serving
Jiangfei Duan, Runyu Lu, Haojie Duanmu, Xiuhong Li +4
2024-06-14
Machine Learning · Computer Science
Fast Distributed Inference Serving for Large Language Models
Bingyang Wu, Yinmin Zhong, Zili Zhang, Shengyu Liu +5
2024-09-26
Distributed, Parallel, and Cluster Computing · Computer Science
MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool
Cunchen Hu, Heyang Huang, Junhao Hu, Jiang Xu +7
2024-12-24
Distributed, Parallel, and Cluster Computing · Computer Science
LLMServingSim 2.0: A Unified Simulator for Heterogeneous and Disaggregated LLM Serving Infrastructure
Jaehong Cho, Hyunmin Choi, Guseul Heo, Jongse Park
2026-03-24
Distributed, Parallel, and Cluster Computing · Computer Science
DeepServe: Serverless Large Language Model Serving at Scale
Junhao Hu, Jiang Xu, Zhixia Liu, Yulong He +17
2025-06-10
Software Engineering · Computer Science
iServe: An Intent-based Serving System for LLMs
Dimitrios Liakopoulos, Tianrui Hu, Prasoon Sinha, Neeraja J. Yadwadkar
2025-01-24
Distributed, Parallel, and Cluster Computing · Computer Science
LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism
Bingyang Wu, Shengyu Liu, Yinmin Zhong, Peng Sun +2
2024-10-30
Distributed, Parallel, and Cluster Computing · Computer Science
Scalable Engine and the Performance of Different LLM Models in a SLURM based HPC architecture
Anderson de Lima Luiz, Shubham Vijay Kurlekar, Munir Georges
2025-08-26
Distributed, Parallel, and Cluster Computing · Computer Science
ThunderServe: High-performance and Cost-efficient LLM Serving in Cloud Environments
Youhe Jiang, Fangcheng Fu, Xiaozhe Yao, Taiyi Wang +3
2025-11-07
Distributed, Parallel, and Cluster Computing · Computer Science
P/D-Serve: Serving Disaggregated Large Language Model at Scale
Yibo Jin, Tao Wang, Huimin Lin, Mingyang Song +26
2024-08-16
Distributed, Parallel, and Cluster Computing · Computer Science
OServe: Accelerating LLM Serving via Spatial-Temporal Workload Orchestration
Youhe Jiang, Fangcheng Fu, Taiyi Wang, Guoliang He +1
2026-05-05
Distributed, Parallel, and Cluster Computing · Computer Science
SplitLLM: Collaborative Inference of LLMs for Model Placement and Throughput Optimization
Akrit Mudvari, Yuang Jiang, Leandros Tassiulas
2024-10-17
Distributed, Parallel, and Cluster Computing · Computer Science
StreamServe: Adaptive Speculative Flows for Low-Latency Disaggregated LLM Serving
Satyam Kumar, Arpit Singh Gautam, Kailash Talreja, Saurabh Jha
2026-04-14
Distributed, Parallel, and Cluster Computing · Computer Science
Taming the Memory Footprint Crisis: System Design for Production Diffusion LLM Serving
Jiakun Fan, Yanglin Zhang, Xiangchen Li, Dimitrios S. Nikolopoulos
2026-01-16
Distributed, Parallel, and Cluster Computing · Computer Science
DeServe: Towards Affordable Offline LLM Inference via Decentralization
Linyu Wu, Xiaoyuan Liu, Tianneng Shi, Zhe Ye +1
2025-01-28
Distributed, Parallel, and Cluster Computing · Computer Science
AlignedServe: Orchestrating Prefix-aware Batching to Build a High-throughput and Computing-efficient LLM Serving System
Fengyao Bai, Hongbin Zhang, Zhitao Chen, Jiangsu Du +2
2026-05-25
Databases · Computer Science
RelServe: Fast LLM Inference Serving on Relational Data
Xin Zhang, Shihong Gao, Yanyan Shen, Haoyang Li +1
2026-01-21
Distributed, Parallel, and Cluster Computing · Computer Science
RAPID-Serve: Resource-efficient and Accelerated P/D Intra-GPU Disaggregation
Amna Masood, Pratishtha Gaur, Nuwan Jayasena
2026-01-21
Computation and Language · Computer Science
AdaServe: Accelerating Multi-SLO LLM Serving with SLO-Customized Speculative Decoding
Zikun Li, Zhuofu Chen, Remi Delacourt, Gabriele Oliaro +10
2025-05-20
Distributed, Parallel, and Cluster Computing · Computer Science
LLMServingSim: A HW/SW Co-Simulation Infrastructure for LLM Inference Serving at Scale
Jaehong Cho, Minsu Kim, Hyunmin Choi, Guseul Heo +1
2024-12-02