Hardware Architecture · Computer Science
Analysis of LLM Vulnerability to GPU Soft Errors: An Instruction-Level Fault Injection Study
Duo Chai, Zizhen Liu, Shuhuai Wang, Songwei Pei +3
2026-01-29
Computation and Language · Computer Science
A Survey on Efficient Inference for Large Language Models
Zixuan Zhou, Xuefei Ning, Ke Hong, Tianyu Fu +11
2024-07-22
Distributed, Parallel, and Cluster Computing · Computer Science
Disaggregated Prefill and Decoding Inference System for Large Language Model Serving on Multi-Vendor GPUs
Xing Chen, Rong Shi, Lu Zhao, Lingbin Wang +3
2025-09-30
Computation and Language · Computer Science
LLM Inference Unveiled: Survey and Roofline Model Insights
Zhihang Yuan, Yuzhang Shang, Yang Zhou, Zhen Dong +10
2024-05-03
Machine Learning · Computer Science
LLM-Inference-Bench: Inference Benchmarking of Large Language Models on AI Accelerators
Krishna Teja Chitty-Venkata, Siddhisanket Raskar, Bharat Kale, Farah Ferdaus +5
2024-11-04
Hardware Architecture · Computer Science
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
Jinhao Li, Jiaming Xu, Shan Huang, Yonghua Chen +8
2025-06-16
Distributed, Parallel, and Cluster Computing · Computer Science
Large-Scale LLM Inference with Heterogeneous Workloads: Prefill-Decode Contention and Asymptotically Optimal Control
Ruihan Lin, Zezhen Ding, Zean Han, Jiheng Zhang
2026-02-04
Machine Learning · Computer Science
LLM-PQ: Serving LLM on Heterogeneous Clusters with Phase-Aware Partition and Adaptive Quantization
Juntao Zhao, Borui Wan, Yanghua Peng, Haibin Lin +1
2024-03-05
Hardware Architecture · Computer Science
Performance Modeling and Workload Analysis of Distributed Large Language Model Training and Inference
Joyjit Kundu, Wenzhe Guo, Ali BanaGozar, Udari De Alwis +3
2024-07-23
Distributed, Parallel, and Cluster Computing · Computer Science
Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities
Zhixiong Chen, Bingjie Zhu, Jiangzhou Wang, Hyundong Shin +2
2026-04-28
Machine Learning · Computer Science
The Remarkable Robustness of LLMs: Stages of Inference?
Vedang Lad, Jin Hwa Lee, Wes Gurnee, Max Tegmark
2025-06-17
Distributed, Parallel, and Cluster Computing · Computer Science
Efficient Fine-Grained GPU Performance Modeling for Distributed Deep Learning of LLM
Biyao Zhang, Mingkai Zheng, Debargha Ganguly, Xuecen Zhang +3
2025-09-30
Machine Learning · Computer Science
On Evaluating Performance of LLM Inference Serving Systems
Amey Agrawal, Nitin Kedia, Anmol Agarwal, Jayashree Mohan +4
2025-07-15
Computation and Language · Computer Science
Taming the Titans: A Survey of Efficient LLM Inference Serving
Ranran Zhen, Juntao Li, Yixin Ji, Zhenlin Yang +6
2025-04-29
Computation and Language · Computer Science
LLMs Explain't: A Post-Mortem on Semantic Interpretability in Transformer Models
Alhassan Abdelhalim, Janick Edinger, Sören Laue, Michaela Regneri
2026-02-02
Distributed, Parallel, and Cluster Computing · Computer Science
Understand and Accelerate Memory Processing Pipeline for Disaggregated LLM Inference
Zifan He, Rui Ma, Yizhou Sun, Jason Cong
2026-05-12
Distributed, Parallel, and Cluster Computing · Computer Science
Characterizing Communication Patterns in Distributed Large Language Model Inference
Lang Xu, Kaushik Kandadi Suresh, Quentin Anthony, Nawras Alnaasan +1
2025-07-22
Distributed, Parallel, and Cluster Computing · Computer Science
Can Large Language Models Predict Parallel Code Performance?
Gregory Bolet, Giorgis Georgakoudis, Harshitha Menon, Konstantinos Parasyris +4
2025-05-08
Distributed, Parallel, and Cluster Computing · Computer Science
SplitLLM: Collaborative Inference of LLMs for Model Placement and Throughput Optimization
Akrit Mudvari, Yuang Jiang, Leandros Tassiulas
2024-10-17
Distributed, Parallel, and Cluster Computing · Computer Science
LLM-Pilot: Characterize and Optimize Performance of your LLM Inference Services
Małgorzata Łazuka, Andreea Anghel, Thomas Parnell
2024-10-04
Performance · Computer Science
RAPID-LLM: Resilience-Aware Performance analysis of Infrastructure for Distributed LLM Training and Inference
George Karfakis, Faraz Tahmasebi, Binglu Chen, Lime Yao +4
2025-12-23
Computation and Language · Computer Science
Towards Intrinsic Interpretability of Large Language Models:A Survey of Design Principles and Architectures
Yutong Gao, Qinglin Meng, Yuan Zhou, Liangming Pan
2026-04-21
Hardware Architecture · Computer Science
Efficient LLM inference solution on Intel GPU
Hui Wu, Yi Gan, Feng Yuan, Jing Ma +7
2024-06-25
Hardware Architecture · Computer Science
LIMINAL: Exploring The Frontiers of LLM Decode Performance
Michael Davies, Neal Crago, Karthikeyan Sankaralingam, Christos Kozyrakis
2025-11-17