Computation and Language · Computer Science
Leveraging Routing Dynamics in Mixture-of-Experts Models for Efficient Language Adaptation
Aditi Khandelwal, Marius Mosbach, Verna Dankers, Siva Reddy +1
2026-05-29
Computation and Language · Computer Science
Routing-Aligned Fine-Tuning for Multilingual Downstream Tasks in Mixture-of-Experts Models
Guanzhi Deng, Kuan Wu, Haibo Wang, Shing Yin Wong +2
2026-05-28
Computation and Language · Computer Science
MoEC: Mixture of Expert Clusters
Yuan Xie, Shaohan Huang, Tianyu Chen, Furu Wei
2022-07-20
Computation and Language · Computer Science
Scalable and Efficient MoE Training for Multitask Multilingual Models
Young Jin Kim, Ammar Ahmad Awan, Alexandre Muzio, Andres Felipe Cruz Salinas +5
2021-09-23
Distributed, Parallel, and Cluster Computing · Computer Science
Towards MoE Deployment: Mitigating Inefficiencies in Mixture-of-Expert (MoE) Inference
Haiyang Huang, Newsha Ardalani, Anna Sun, Liu Ke +5
2023-06-21
Machine Learning · Computer Science
MoSE: Mixture of Slimmable Experts for Efficient and Adaptive Language Models
Nurbek Tastan, Stefanos Laskaridis, Karthik Nandakumar, Samuel Horvath
2026-02-09
Computation and Language · Computer Science
Multilingual Routing in Mixture-of-Experts
Lucas Bandarkar, Chenyuan Yang, Mohsen Fayyaz, Junlin Hu +1
2026-02-19
Computation and Language · Computer Science
Understanding Multilingualism in Mixture-of-Experts LLMs: Routing Mechanism, Expert Specialization, and Layerwise Steering
Yuxin Chen, Zhengzhou Cai, Xiangtian Ji, Weixiang Zhao +3
2026-01-21
Machine Learning · Computer Science
Gating Dropout: Communication-efficient Regularization for Sparsely Activated Transformers
Rui Liu, Young Jin Kim, Alexandre Muzio, Hany Hassan Awadalla
2022-07-05
Machine Learning · Computer Science
Mixture of Experts in Large Language Models
Danyang Zhang, Junhao Song, Ziqian Bi, Xinyuan Song +4
2025-12-24
Computer Vision and Pattern Recognition · Computer Science
MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models
Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee +2
2026-03-31
Computation and Language · Computer Science
Advancing Expert Specialization for Better MoE
Hongcan Guo, Haolang Lu, Guoshun Nan, Bolun Chu +7
2026-01-27
Machine Learning · Computer Science
LocMoE: A Low-Overhead MoE for Large Language Model Training
Jing Li, Zhijie Sun, Xuan He, Li Zeng +5
2024-05-24
Machine Learning · Computer Science
StableMoE: Stable Routing Strategy for Mixture of Experts
Damai Dai, Li Dong, Shuming Ma, Bo Zheng +3
2022-04-19
Computation and Language · Computer Science
Adaptive Gating in Mixture-of-Experts based Language Models
Jiamin Li, Qiang Su, Yitao Yang, Yimin Jiang +2
2023-10-12
Computation and Language · Computer Science
Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs
Bo Li, Tianyu Dong, Shaolin Zhu, Deyi Xiong
2026-05-26
Computation and Language · Computer Science
Task-Based MoE for Multitask Multilingual Machine Translation
Hai Pham, Young Jin Kim, Subhabrata Mukherjee, David P. Woodruff +2
2023-10-26
Computation and Language · Computer Science
Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource
Houyi Li, Ka Man Lo, Shijie Xuyang, Ziqi Wang +6
2026-05-19
Computation and Language · Computer Science
Rewiring Experts on the Fly:Continuous Rerouting for Better Online Adaptation in Mixture-of-Expert models
Guinan Su, Yanwu Yang, Li Shen, Lu Yin +2
2025-10-17
Computation and Language · Computer Science
Unveiling Language Routing Isolation in Multilingual MoE Models for Interpretable Subnetwork Adaptation
Kening Zheng, Wei-Chieh Huang, Jiahao Huo, Zhonghao Li +8
2026-04-07
Computation and Language · Computer Science
Building a great multi-lingual teacher with sparsely-gated mixture of experts for speech recognition
Kenichi Kumatani, Robert Gmyr, Felipe Cruz Salinas, Linquan Liu +4
2022-01-05
Machine Learning · Computer Science
MoE Routing Testbed: Studying Expert Specialization and Routing Behavior at Small Scale
Tobias Falke, Nicolas Anastassacos, Samson Tan, Chankrisna Richy Meas +5
2026-04-09
Machine Learning · Computer Science
HyperMoE: Towards Better Mixture of Experts via Transferring Among Experts
Hao Zhao, Zihan Qiu, Huijia Wu, Zili Wang +2
2024-07-26
Computation and Language · Computer Science
MaskMoE: Boosting Token-Level Learning via Routing Mask in Mixture-of-Experts
Zhenpeng Su, Zijia Lin, Xue Bai, Xing Wu +7
2024-08-30