Performance · Computer Science
A Comprehensive Performance Study of Large Language Models on Novel AI Accelerators
Murali Emani, Sam Foreman, Varuni Sastry, Zhen Xie +5
2023-10-10
Machine Learning · Computer Science
WaferLLM: Large Language Model Inference at Wafer Scale
Congjie He, Yeqi Huang, Pei Mu, Ziming Miao +4
2025-06-02
Distributed, Parallel, and Cluster Computing · Computer Science
Scaling Studies for Efficient Parameter Search and Parallelism for Large Language Model Pre-training
Michael Benington, Leo Phan, Chris Pierre Paul, Evan Shoemaker +4
2023-10-12
Machine Learning · Computer Science
LLM-Inference-Bench: Inference Benchmarking of Large Language Models on AI Accelerators
Krishna Teja Chitty-Venkata, Siddhisanket Raskar, Bharat Kale, Farah Ferdaus +5
2024-11-04
Hardware Architecture · Computer Science
From Principles to Practice: A Systematic Study of LLM Serving on Multi-core NPUs
Tianhao Zhu, Dahu Feng, Erhu Feng, Yubin Xia
2025-10-08
Artificial Intelligence · Computer Science
Inference Optimization of Foundation Models on AI Accelerators
Youngsuk Park, Kailash Budhathoki, Liangfu Chen, Jonas Kübler +6
2024-10-02
Hardware Architecture · Computer Science
Performance Modeling and Workload Analysis of Distributed Large Language Model Training and Inference
Joyjit Kundu, Wenzhe Guo, Ali BanaGozar, Udari De Alwis +3
2024-07-23
Computation and Language · Computer Science
Speed Always Wins: A Survey on Efficient Architectures for Large Language Models
Weigao Sun, Jiaxi Hu, Yucheng Zhou, Jusen Du +11
2025-08-14
Hardware Architecture · Computer Science
Scaling Intelligence: Designing Data Centers for Next-Gen Language Models
Jesmin Jahan Tithi, Hanjiang Wu, Avishaii Abuhatzera, Fabrizio Petrini
2025-09-09
Distributed, Parallel, and Cluster Computing · Computer Science
AcceLLM: Accelerating LLM Inference using Redundancy for Load Balancing and Data Locality
Ilias Bournias, Lukas Cavigelli, Georgios Zacharopoulos
2024-11-11
Distributed, Parallel, and Cluster Computing · Computer Science
Characterizing Communication Patterns in Distributed Large Language Model Inference
Lang Xu, Kaushik Kandadi Suresh, Quentin Anthony, Nawras Alnaasan +1
2025-07-22
Hardware Architecture · Computer Science
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
Yanbiao Liang, Huihong Shi, Haikuo Shao, Zhongfeng Wang
2025-05-08
Machine Learning · Computer Science
Comprehensive Performance Modeling and System Design Insights for Foundation Models
Shashank Subramanian, Ermal Rrapaj, Peter Harrington, Smeet Chheda +5
2024-10-02
Distributed, Parallel, and Cluster Computing · Computer Science
Understanding Inference Scaling for LLMs: Bottlenecks, Trade-offs, and Performance Principles
Moiz Arif, Avinash Maurya, Sudharshan Vazhkudai, Bogdan Nicolae
2026-05-20
Hardware Architecture · Computer Science
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
Jinhao Li, Jiaming Xu, Shan Huang, Yonghua Chen +8
2025-06-16
Machine Learning · Computer Science
Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training
Jared Fernandez, Luca Wehrstedt, Leonid Shamis, Mostafa Elhoushi +4
2025-04-15
Distributed, Parallel, and Cluster Computing · Computer Science
Inference Acceleration for Large Language Models on CPUs
Ditto PS, Jithin VG, Adarsh MS
2024-06-13
Distributed, Parallel, and Cluster Computing · Computer Science
Characterizing the Efficiency of Distributed Training: A Power, Performance, and Thermal Perspective
Seokjin Go, Joongun Park, Spandan More, Hanjiang Wu +4
2025-09-22
Distributed, Parallel, and Cluster Computing · Computer Science
Characterization of Large Language Model Development in the Datacenter
Qinghao Hu, Zhisheng Ye, Zerui Wang, Guoteng Wang +8
2024-04-05
Distributed, Parallel, and Cluster Computing · Computer Science
Parallelization Strategies for Dense LLM Deployment: Navigating Through Application-Specific Tradeoffs and Bottlenecks
Burak Topcu, Musa Oguzhan Cim, Poovaiah Palangappa, Meena Arunachalam +1
2026-03-09
Machine Learning · Computer Science
Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores
Shaobo Ma, Chao Fang, Haikuo Shao, Zhongfeng Wang
2025-03-14