Computation and Language · Computer Science
Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding
Chengyue Wu, Hao Zhang, Shuchen Xue, Zhijian Liu +5
2025-07-04
Distributed, Parallel, and Cluster Computing · Computer Science
CacheFlow: Efficient LLM Serving with 3D-Parallel KV Cache Restoration
Sean Nian, Jiahao Fang, Qilong Feng, Zhiyu Wu +1
2026-04-29
Machine Learning · Computer Science
TokenFlow: Responsive LLM Text Streaming Serving under Request Burst via Preemptive Scheduling
Junyi Chen, Chuheng Du, Renyuan Liu, Shuochao Yao +5
2025-10-06
Distributed, Parallel, and Cluster Computing · Computer Science
KVDirect: Distributed Disaggregated LLM Inference
Shiyang Chen, Rain Jiang, Dezhi Yu, Jinlai Xu +5
2025-01-28
Computation and Language · Computer Science
FlashDLM: Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion
Zhanqiu Hu, Jian Meng, Yash Akhauri, Mohamed S. Abdelfattah +3
2025-10-10
Operating Systems · Computer Science
ContiguousKV: Accelerating LLM Prefill with Granularity-Aligned KV Cache Management
Jing Zou, Shangyu Wu, Hancong Duan, Qiao Li +1
2026-01-21
Distributed, Parallel, and Cluster Computing · Computer Science
KVServe: Service-Aware KV Cache Compression for Communication-Efficient Disaggregated LLM Serving
Zedong Liu, Xinyang Ma, Dejun Luo, Hairui Zhao +8
2026-05-14
Multimedia · Computer Science
FastCache: Optimizing Multimodal LLM Serving through Lightweight KV-Cache Compression Framework
Jianian Zhu, Hang Wu, Haojie Wang, Yinghui Li +3
2025-03-12
Computation and Language · Computer Science
d$^2$Cache: Accelerating Diffusion-Based LLMs via Dual Adaptive Caching
Yuchu Jiang, Yue Cai, Xiangzhong Luo, Jiale Fu +3
2026-02-17
Distributed, Parallel, and Cluster Computing · Computer Science
AlignedServe: Orchestrating Prefix-aware Batching to Build a High-throughput and Computing-efficient LLM Serving System
Fengyao Bai, Hongbin Zhang, Zhitao Chen, Jiangsu Du +2
2026-05-25
Performance · Computer Science
Revisiting Disaggregated Large Language Model Serving for Performance and Energy Implications
Jiaxi Li, Yue Zhu, Eun Kyung Lee, Klara Nahrstedt
2026-01-15
Computation and Language · Computer Science
dKV-Cache: The Cache for Diffusion Language Models
Xinyin Ma, Runpeng Yu, Gongfan Fang, Xinchao Wang
2025-05-22
Hardware Architecture · Computer Science
VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator
Zhican Wang, Hongxiang Fan, Haroon Waris, Gang Wang +4
2025-07-02
Distributed, Parallel, and Cluster Computing · Computer Science
D\'ej\`a Vu: Efficient Video-Language Query Engine with Learning-based Inter-Frame Computation Reuse
Jinwoo Hwang, Daeun Kim, Sangyeop Lee, Yoonsung Kim +7
2025-09-11
Distributed, Parallel, and Cluster Computing · Computer Science
Taming the Memory Footprint Crisis: System Design for Production Diffusion LLM Serving
Jiakun Fan, Yanglin Zhang, Xiangchen Li, Dimitrios S. Nikolopoulos
2026-01-16
Distributed, Parallel, and Cluster Computing · Computer Science
DisagFusion: Asynchronous Pipeline Parallelism and Elastic Scheduling for Disaggregated Diffusion Serving
Hantian Zha, Teng Ma, Yang Yong, Haiwen Fu +6
2026-05-26
Distributed, Parallel, and Cluster Computing · Computer Science
FlowKV: A Disaggregated Inference Framework with Low-Latency KV Cache Transfer and Load-Aware Scheduling
Weiqing Li, Guochao Jiang, Xiangyong Ding, Zhangcheng Tao +4
2025-04-08
Distributed, Parallel, and Cluster Computing · Computer Science
BanaServe: Unified KV Cache and Dynamic Module Migration for Balancing Disaggregated LLM Serving in AI Infrastructure
Yiyuan He, Minxian Xu, Jingfeng Wu, Jianmin Hu +6
2026-03-11
Performance · Computer Science
HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing
Mao Lin, Xi Wang, Guilherme Cox, Dong Li +1
2026-04-21
Machine Learning · Computer Science
PrefillShare: A Shared Prefill Module for KV Reuse in Multi-LLM Disaggregated Serving
Sunghyeon Woo, Hoseung Kim, Sunghwan Shim, Minjung Jo +7
2026-02-13
Machine Learning · Computer Science
The Pitfalls of KV Cache Compression
Alex Chen, Renato Geh, Aditya Grover, Guy Van den Broeck +1
2026-05-15