Machine Learning · Computer Science
eMoE: Task-aware Memory Efficient Mixture-of-Experts-Based (MoE) Model Inference
Suraiya Tairin, Shohaib Mahmud, Haiying Shen, Anand Iyer
2025-03-11
Machine Learning · Computer Science
Fast MoE Inference via Predictive Prefetching and Expert Replication
Ankit Jyothish, Ali Jannesari, Aishwarya Sarkar, Joseph Zuber
2026-05-13
Artificial Intelligence · Computer Science
SMoE: An Algorithm-System Co-Design for Pushing MoE to the Edge via Expert Substitution
Guoying Zhu, Meng Li, Haipeng Dai, Xuechen Liu +5
2026-05-05
Computation and Language · Computer Science
Pushing Mixture of Experts to the Limit: Extremely Parameter Efficient MoE for Instruction Tuning
Ted Zadouri, Ahmet Üstün, Arash Ahmadian, Beyza Ermiş +2
2023-09-12
Machine Learning · Computer Science
Mixture of Lookup Experts
Shibo Jie, Yehui Tang, Kai Han, Yitong Li +3
2025-05-27
Machine Learning · Computer Science
Speculating Experts Accelerates Inference for Mixture-of-Experts
Vivan Madan, Prajwal Singhania, Abhinav Bhatele, Tom Goldstein +1
2026-03-23
Distributed, Parallel, and Cluster Computing · Computer Science
MemFine: Memory-Aware Fine-Grained Scheduling for MoE Training
Lu Zhao, Rong Shi, Shaoqing Zhang, Yueqiang Chen +20
2026-01-14
Computation and Language · Computer Science
MoBiLE: Efficient Mixture-of-Experts Inference on Consumer GPU with Mixture of Big Little Experts
Yushu Zhao, Yubin Qin, Yang Wang, Xiaolong Yang +4
2025-10-15
Artificial Intelligence · Computer Science
SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding
Jehyeon Bang, Eunyeong Cho, Ranggi Hwang, Jinha Chung +1
2026-04-14
Machine Learning · Computer Science
BuddyMoE: Exploiting Expert Redundancy to Accelerate Memory-Constrained Mixture-of-Experts Inference
Yun Wang, Lingyun Yang, Senhao Yu, Yixiao Wang +4
2025-11-14
Machine Learning · Computer Science
A Survey on Inference Optimization Techniques for Mixture of Experts Models
Jiacheng Liu, Peng Tang, Wenfeng Wang, Yuhang Ren +4
2025-01-23
Machine Learning · Computer Science
A Provably Effective Method for Pruning Experts in Fine-tuned Sparse Mixture-of-Experts
Mohammed Nowaz Rabbani Chowdhury, Meng Wang, Kaoutar El Maghraoui, Naigang Wang +2
2024-05-31
Machine Learning · Computer Science
ReMoE: Boosting Expert Reuse through Router Fine-Tuning in Memory-Constrained MoE LLM Inference
Xiongwei Zhu, Xiaojian Liao, Tianyang Jiang, Yusen Zhang +2
2026-05-27
Distributed, Parallel, and Cluster Computing · Computer Science
A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems
Qi Wu, Chao Fang, Jiayuan Chen, Ye Lin +4
2026-01-08
Machine Learning · Computer Science
Efficiently Editing Mixture-of-Experts Models with Compressed Experts
Yifei He, Yang Liu, Chen Liang, Hany Hassan Awadalla
2025-09-04
Distributed, Parallel, and Cluster Computing · Computer Science
ExpertFlow: Adaptive Expert Scheduling and Memory Coordination for Efficient MoE Inference
Zixu Shen, Kexin Chu, Yifan Zhang, Dawei Xiang +2
2025-10-31
Artificial Intelligence · Computer Science
ExpertFlow: Efficient Mixture-of-Experts Inference via Predictive Expert Caching and Token Scheduling
Xin He, Shunkang Zhang, Kaijie Tang, Shaohuai Shi +7
2026-04-03
Machine Learning · Computer Science
FloE: On-the-Fly MoE Inference on Memory-constrained GPU
Yuxin Zhou, Zheng Li, Jun Zhang, Jue Wang +4
2025-05-13
Computation and Language · Computer Science
Faster MoE LLM Inference for Extremely Large Models
Haoqi Yang, Luohe Shi, Qiwei Li, Zuchao Li +4
2025-05-07
Machine Learning · Computer Science
Accelerating Mixture-of-Expert Inference with Adaptive Expert Split Mechanism
Jiaming Yan, Jianchun Liu, Hongli Xu, Liusheng Huang
2025-09-11
Distributed, Parallel, and Cluster Computing · Computer Science
HarMoEny: Efficient Multi-GPU Inference of MoE Models
Zachary Doucet, Rishi Sharma, Martijn de Vos, Rafael Pires +2
2025-06-18
Machine Learning · Computer Science
MoNDE: Mixture of Near-Data Experts for Large-Scale Sparse Models
Taehyun Kim, Kwanseok Choi, Youngmock Cho, Jaehoon Cho +2
2024-05-30
Distributed, Parallel, and Cluster Computing · Computer Science
Accelerating Mixture-of-Experts Inference by Hiding Offloading Latency with Speculative Decoding
Zhibin Wang, Zhonghui Zhang, Yuhang Zhou, Zibo Wang +7
2025-11-03
Machine Learning · Computer Science
Mixture of Parrots: Experts improve memorization more than reasoning
Samy Jelassi, Clara Mohri, David Brandfonbrener, Alex Gu +6
2025-03-04
Distributed, Parallel, and Cluster Computing · Computer Science
Efficient CPU-GPU Collaborative Inference for MoE-based LLMs on Memory-Limited Systems
En-Ming Huang, Li-Shang Lin, Chun-Yi Lee
2025-12-19