Computation and Language · Computer Science
Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding
Heming Xia, Zhe Yang, Qingxiu Dong, Peiyi Wang +5
2024-06-05
Computation and Language · Computer Science
Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
Shengyin Sun, Yiming Li, Xing Li, Yingzhao Lian +7
2025-09-08
Computation and Language · Computer Science
The Disparate Impacts of Speculative Decoding
Jameson Sandler, Ahmet Üstün, Marco Romanelli, Sara Hooker +1
2025-10-03
Machine Learning · Computer Science
A Theoretical Perspective for Speculative Decoding Algorithm
Ming Yin, Minshuo Chen, Kaixuan Huang, Mengdi Wang
2024-11-05
Computation and Language · Computer Science
Scaling LLM Speculative Decoding: Non-Autoregressive Forecasting in Large-Batch Scenarios
Luohe Shi, Zuchao Li, Lefei Zhang, Baoyuan Qi +2
2025-11-26
Machine Learning · Computer Science
SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models
Hang Wu, Jianian Zhu, Yinghui Li, Haojie Wang +2
2025-05-13
Artificial Intelligence · Computer Science
Online Speculative Decoding
Xiaoxuan Liu, Lanxiang Hu, Peter Bailis, Alvin Cheung +3
2024-06-11
Computation and Language · Computer Science
Decoding Uncertainty: The Impact of Decoding Strategies for Uncertainty Estimation in Large Language Models
Wataru Hashimoto, Hidetaka Kamigaito, Taro Watanabe
2025-09-23
Information Retrieval · Computer Science
Efficiency Unleashed: Inference Acceleration for LLM-based Recommender Systems with Speculative Decoding
Yunjia Xi, Hangyu Wang, Bo Chen, Jianghao Lin +6
2025-04-30
Computation and Language · Computer Science
Automatic Task Detection and Heterogeneous LLM Speculative Decoding
Danying Ge, Jianhua Gao, Qizhi Jiang, Yifei Feng +1
2025-05-14
Computation and Language · Computer Science
Speculative Decoding: Performance or Illusion?
Xiaoxuan Liu, Jiaxiang Yu, Jongseok Park, Ion Stoica +1
2026-03-19
Computation and Language · Computer Science
Energy Considerations of Large Language Model Inference and Efficiency Optimizations
Jared Fernandez, Clara Na, Vashisth Tiwari, Yonatan Bisk +2
2025-04-25
Computation and Language · Computer Science
Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions
Bangsheng Tang, Carl Chengyan Fu, Fei Kou, Grigory Sizov +34
2025-08-12
Computation and Language · Computer Science
A Thorough Examination of Decoding Methods in the Era of LLMs
Chufan Shi, Haoran Yang, Deng Cai, Zhisong Zhang +3
2024-10-10
Distributed, Parallel, and Cluster Computing · Computer Science
SLED: A Speculative LLM Decoding Framework for Efficient Edge Serving
Xiangchen Li, Dimitrios Spatharakis, Saeid Ghafouri, Jiakun Fan +4
2025-11-06
Computation and Language · Computer Science
Faster Cascades via Speculative Decoding
Harikrishna Narasimhan, Wittawat Jitkrittum, Ankit Singh Rawat, Seungyeon Kim +3
2024-10-23
Computation and Language · Computer Science
Tutorial Proposal: Speculative Decoding for Efficient LLM Inference
Heming Xia, Cunxiao Du, Yongqi Li, Qian Liu +1
2025-03-04
Computation and Language · Computer Science
Towards Sustainable NLP: Insights from Benchmarking Inference Energy in Large Language Models
Soham Poddar, Paramita Koley, Janardan Misra, Sanjay Podder +2
2025-03-18