Distributed, Parallel, and Cluster Computing · Computer Science
WWW.Serve: Interconnecting Global LLM Services through Decentralization
Huanyu Wang, Ziyu Xia, Zhuoming Chen, Beidi Chen
2026-03-25
Machine Learning · Computer Science
Fast Distributed Inference Serving for Large Language Models
Bingyang Wu, Yinmin Zhong, Zili Zhang, Shengyu Liu +5
2024-09-26
Distributed, Parallel, and Cluster Computing · Computer Science
Parallax: Efficient LLM Inference Service over Decentralized Environment
Chris Tong, Youhe Jiang, Gufeng Chen, Tianyi Zhao +5
2025-10-01
Distributed, Parallel, and Cluster Computing · Computer Science
ConServe: Fine-Grained GPU Harvesting for LLM Online and Offline Co-Serving
Yifan Qiao, Shu Anzai, Shan Yu, Haoran Ma +9
2025-09-05
Distributed, Parallel, and Cluster Computing · Computer Science
DeepServe: Serverless Large Language Model Serving at Scale
Junhao Hu, Jiang Xu, Zhixia Liu, Yulong He +17
2025-06-10
Distributed, Parallel, and Cluster Computing · Computer Science
CALVO: Improve Serving Efficiency for LLM Inferences with Intense Network Demands
Weiye Wang, Chen Chen, Junxue Zhang, Zhusheng Wang +6
2026-03-24
Software Engineering · Computer Science
iServe: An Intent-based Serving System for LLMs
Dimitrios Liakopoulos, Tianrui Hu, Prasoon Sinha, Neeraja J. Yadwadkar
2025-01-24
Machine Learning · Computer Science
ServerlessLLM: Low-Latency Serverless Inference for Large Language Models
Yao Fu, Leyang Xue, Yeqi Huang, Andrei-Octavian Brabete +3
2024-07-26
Computation and Language · Computer Science
AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving
Ying Wang, Zhen Jin, Jiexiong Xu, Wenhai Lin +2
2025-12-17
Distributed, Parallel, and Cluster Computing · Computer Science
A System for Microserving of LLMs
Hongyi Jin, Ruihang Lai, Charlie F. Ruan, Yingcheng Wang +4
2024-12-18
Distributed, Parallel, and Cluster Computing · Computer Science
SplitLLM: Collaborative Inference of LLMs for Model Placement and Throughput Optimization
Akrit Mudvari, Yuang Jiang, Leandros Tassiulas
2024-10-17
Distributed, Parallel, and Cluster Computing · Computer Science
PlanetServe: A Decentralized, Scalable, and Privacy-Preserving Overlay for Democratizing Large Language Model Serving
Fei Fang, Yifan Hua, Shengze Wang, Ruilin Zhou +3
2026-02-16
Distributed, Parallel, and Cluster Computing · Computer Science
RAPID-Serve: Resource-efficient and Accelerated P/D Intra-GPU Disaggregation
Amna Masood, Pratishtha Gaur, Nuwan Jayasena
2026-01-21
Systems and Control · Electrical Eng. & Systems
Efficient LLM Inference over Heterogeneous Edge Networks with Speculative Decoding
Bingjie Zhu, Zhixiong Chen, Liqiang Zhao, Hyundong Shin +1
2025-10-14
Distributed, Parallel, and Cluster Computing · Computer Science
SageServe: Optimizing LLM Serving on Cloud Data Centers with Forecast Aware Auto-Scaling
Shashwat Jaiswal, Kunal Jain, Yogesh Simmhan, Anjaly Parayil +8
2025-11-14
Distributed, Parallel, and Cluster Computing · Computer Science
ThunderServe: High-performance and Cost-efficient LLM Serving in Cloud Environments
Youhe Jiang, Fangcheng Fu, Xiaozhe Yao, Taiyi Wang +3
2025-11-07
Distributed, Parallel, and Cluster Computing · Computer Science
Demystifying Cost-Efficiency in LLM Serving over Heterogeneous GPUs
Youhe Jiang, Fangcheng Fu, Xiaozhe Yao, Guoliang He +5
2025-06-06
Distributed, Parallel, and Cluster Computing · Computer Science
GoodServe: Towards High-Goodput Serving of Agentic LLM Inferences over Heterogeneous Resources
Boxiao Du, Boning Huangfu, Yizhou Luo, Chen Chen +4
2026-05-19
Machine Learning · Computer Science
Apt-Serve: Adaptive Request Scheduling on Hybrid Cache for Scalable LLM Inference Serving
Shihong Gao, Xin Zhang, Yanyan Shen, Lei Chen
2025-04-11
Machine Learning · Computer Science
BlendServe: Optimizing Offline Inference for Auto-regressive Large Models with Resource-aware Batching
Yilong Zhao, Shuo Yang, Kan Zhu, Lianmin Zheng +4
2024-11-26
Distributed, Parallel, and Cluster Computing · Computer Science
{\lambda}Scale: Enabling Fast Scaling for Serverless Large Language Model Inference
Minchen Yu, Rui Yang, Chaobo Jia, Zhaoyuan Su +8
2026-03-09
Distributed, Parallel, and Cluster Computing · Computer Science
WarmServe: Enabling One-for-Many GPU Prewarming for Multi-LLM Serving
Chiheng Lou, Sheng Qi, Rui Kang, Yong Zhang +4
2026-05-22
Distributed, Parallel, and Cluster Computing · Computer Science
Cloud Native System for LLM Inference Serving
Minxian Xu, Junhan Liao, Jingfeng Wu, Yiyuan He +2
2025-07-25