Machine Learning · Computer Science
SparQ Attention: Bandwidth-Efficient LLM Inference
Luka Ribar, Ivan Chelombiev, Luke Hudlass-Galley, Charlie Blake +2
2024-09-05
Artificial Intelligence · Computer Science
DeltaLLM: A Training-Free Framework Exploiting Temporal Sparsity for Efficient Edge LLM Inference
Jiawen Qi, Chang Gao, Zhaochun Ren, Qinyu Chen
2025-07-29
Computation and Language · Computer Science
GTA: Grouped-head latenT Attention
Luoyang Sun, Cheng Deng, Jiwen Jiang, Xinjian Wu +4
2025-07-24
Computation and Language · Computer Science
AsyncTLS: Efficient Generative LLM Inference with Asynchronous Two-level Sparse Attention
Yuxuan Hu, Jianchao Tan, Jiaqi Zhang, Wen Zan +6
2026-04-10
Distributed, Parallel, and Cluster Computing · Computer Science
Improving the End-to-End Efficiency of Offline Inference for Multi-LLM Applications Based on Sampling and Simulation
Jingzhi Fang, Yanyan Shen, Yue Wang, Lei Chen
2025-03-24
Distributed, Parallel, and Cluster Computing · Computer Science
Large Language Model Partitioning for Low-Latency Inference at the Edge
Dimitrios Kafetzis, Ramin Khalili, Iordanis Koutsopoulos
2025-05-06
Distributed, Parallel, and Cluster Computing · Computer Science
AcceLLM: Accelerating LLM Inference using Redundancy for Load Balancing and Data Locality
Ilias Bournias, Lukas Cavigelli, Georgios Zacharopoulos
2024-11-11
Machine Learning · Computer Science
DISTFLASHATTN: Distributed Memory-efficient Attention for Long-context LLMs Training
Dacheng Li, Rulin Shao, Anze Xie, Eric P. Xing +4
2024-04-02
Distributed, Parallel, and Cluster Computing · Computer Science
SplitLLM: Collaborative Inference of LLMs for Model Placement and Throughput Optimization
Akrit Mudvari, Yuang Jiang, Leandros Tassiulas
2024-10-17
Distributed, Parallel, and Cluster Computing · Computer Science
BurstEngine: an Efficient Distributed Framework for Training Transformers on Extremely Long Sequences of over 1M Tokens
Ao Sun, Weilin Zhao, Xu Han, Cheng Yang +3
2025-09-25
Machine Learning · Computer Science
Efficient Low Rank Attention for Long-Context Inference in Large Language Models
Tenghui Li, Guoxu Zhou, Xuyang Zhao, Yuning Qiu +1
2025-12-24
Computation and Language · Computer Science
AttnCache: Accelerating Self-Attention Inference for LLM Prefill via Attention Cache
Dinghong Song, Yuan Feng, Yiwei Wang, Shangye Chen +5
2025-11-13
Machine Learning · Computer Science
HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference
Ping Gong, Jiawei Yi, Shengnan Wang, Juncheng Zhang +12
2025-06-04
Machine Learning · Computer Science
ServerlessLLM: Low-Latency Serverless Inference for Large Language Models
Yao Fu, Leyang Xue, Yeqi Huang, Andrei-Octavian Brabete +3
2024-07-26
Computation and Language · Computer Science
Lightning Attention-2: A Free Lunch for Handling Unlimited Sequence Lengths in Large Language Models
Zhen Qin, Weigao Sun, Dong Li, Xuyang Shen +2
2024-01-17
Hardware Architecture · Computer Science
SwiftKV: An Edge-Oriented Attention Algorithm and Multi-Head Accelerator for Fast, Efficient LLM Decoding
Junming Zhang, Qinyan Zhang, Huajun Sun, Feiyang Gao +3
2026-01-19
Hardware Architecture · Computer Science
A Hardware Evaluation Framework for Large Language Model Inference
Hengrui Zhang, August Ning, Rohan Prabhakar, David Wentzlaff
2023-12-07
Distributed, Parallel, and Cluster Computing · Computer Science
Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache
Bin Lin, Chen Zhang, Tao Peng, Hanyu Zhao +11
2024-07-08
Machine Learning · Computer Science
Accelerating LLM Inference Throughput via Asynchronous KV Cache Prefetching
Yanhao Dong, Yubo Miao, Weinan Li, Xiao Zheng +3
2025-11-11
Computation and Language · Computer Science
Lizard: An Efficient Linearization Framework for Large Language Models
Chien Van Nguyen, Huy Nguyen, Ruiyi Zhang, Hanieh Deilamsalehy +9
2026-04-21
Hardware Architecture · Computer Science
A Cost-Effective Near-Storage Processing Solution for Offline Inference of Long-Context LLMs
Hongsun Jang, Jaeyong Song, Changmin Shin, Si Ung Noh +3
2026-02-09
Computer Vision and Pattern Recognition · Computer Science
InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models
Hongyuan Tao, Bencheng Liao, Shaoyu Chen, Haoran Yin +3
2026-04-01