Machine Learning · Computer Science
Accelerating LLM Inference Throughput via Asynchronous KV Cache Prefetching
Yanhao Dong, Yubo Miao, Weinan Li, Xiao Zheng +3
2025-11-11
Distributed, Parallel, and Cluster Computing · Computer Science
Efficient LLM Inference with Activation Checkpointing and Hybrid Caching
Sanghyeon Lee, Hongbeen Kim, Soojin Hwang, Guseul Heo +2
2026-02-03
Machine Learning · Computer Science
XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference
Weizhuo Li, Zhigang Wang, Yu Gu, Ge Yu
2024-12-10
Distributed, Parallel, and Cluster Computing · Computer Science
ConServe: Fine-Grained GPU Harvesting for LLM Online and Offline Co-Serving
Yifan Qiao, Shu Anzai, Shan Yu, Haoran Ma +9
2025-09-05
Hardware Architecture · Computer Science
Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System
Yunhua Fang, Rui Xie, Asad Ul Haq, Linsen Ma +5
2025-09-16
Machine Learning · Computer Science
RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference
Yaoqi Chen, Jinkai Zhang, Baotong Lu, Qianxi Zhang +15
2026-04-28
Hardware Architecture · Computer Science
InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference
Xiurui Pan, Endian Li, Qiao Li, Shengwen Liang +5
2024-09-10
Operating Systems · Computer Science
Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU
He Sun, Li Li, Mingjun Xiao, Chengzhong Xu
2025-07-03
Machine Learning · Computer Science
SpecOffload: Unlocking Latent GPU Capacity for LLM Inference on Resource-Constrained Devices
Xiangwen Zhuge, Xu Shen, Zeyu Wang, Fan Dang +5
2025-05-22
Hardware Architecture · Computer Science
Efficient LLM inference solution on Intel GPU
Hui Wu, Yi Gan, Feng Yuan, Jing Ma +7
2024-06-25
Hardware Architecture · Computer Science
Reimagining Memory Access for LLM Inference: Compression-Aware Memory Controller Design
Rui Xie, Asad Ul Haq, Linsen Ma, Yunhua Fang +3
2025-04-23
Machine Learning · Computer Science
HeadInfer: Memory-Efficient LLM Inference by Head-wise Offloading
Cheng Luo, Zefan Cai, Hanshi Sun, Jinqi Xiao +6
2025-02-19
Distributed, Parallel, and Cluster Computing · Computer Science
Efficient CPU-GPU Collaborative Inference for MoE-based LLMs on Memory-Limited Systems
En-Ming Huang, Li-Shang Lin, Chun-Yi Lee
2025-12-19
Distributed, Parallel, and Cluster Computing · Computer Science
KV Cache Compression for Inference Efficiency in LLMs: A Review
Yanyu Liu, Jingying Fu, Sixiang Liu, Yitian Zou +3
2025-08-11
Machine Learning · Computer Science
InfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache Management
Wonbeom Lee, Jungi Lee, Junghwan Seo, Jaewoong Sim
2024-07-01
Artificial Intelligence · Computer Science
Inference Performance Optimization for Large Language Models on CPUs
Pujiang He, Shan Zhou, Wenhuan Huang, Changqing Li +6
2024-07-11
Performance · Computer Science
HeteGen: Heterogeneous Parallel Inference for Large Language Models on Resource-Constrained Devices
Xuanlei Zhao, Bin Jia, Haotian Zhou, Ziming Liu +2
2024-03-05
Computation and Language · Computer Science
TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization
Dingyu Yao, Bowen Shen, Zheng Lin, Wei Liu +3
2025-05-28
Distributed, Parallel, and Cluster Computing · Computer Science
Mind the Memory Gap: Unveiling GPU Bottlenecks in Large-Batch LLM Inference
Pol G. Recasens, Ferran Agullo, Yue Zhu, Chen Wang +4
2025-07-14
Distributed, Parallel, and Cluster Computing · Computer Science
Large-Scale LLM Inference with Heterogeneous Workloads: Prefill-Decode Contention and Asymptotically Optimal Control
Ruihan Lin, Zezhen Ding, Zean Han, Jiheng Zhang
2026-02-04
Machine Learning · Computer Science
LLM-PQ: Serving LLM on Heterogeneous Clusters with Phase-Aware Partition and Adaptive Quantization
Juntao Zhao, Borui Wan, Yanghua Peng, Haibin Lin +1
2024-03-05
Machine Learning · Computer Science
LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy
Rongzhi Zhang, Kuang Wang, Liyuan Liu, Shuohang Wang +3
2024-10-07
Machine Learning · Computer Science
ScoutAttention: Efficient KV Cache Offloading via Layer-Ahead CPU Pre-computation for LLM Inference
Qiuyang Zhang, Kai Zhou, Ding Tang, Kai Lu +4
2026-03-31