DSelect-k:专家混合中的可微选择及其在多任务学习中的应用
机器学习
2022-01-04 v3 最优化与控制
机器学习
摘要
专家混合(MoE)架构在提升多任务学习(MTL)中的参数共享以及扩展高容量神经网络方面展现出有前景的结果。最先进的MoE模型使用可训练的稀疏门控为每个输入样本选择专家子集。尽管在概念上很有吸引力,现有的稀疏门控(如Top-k)并不平滑。在使用基于梯度的方法训练时,缺乏平滑性会导致收敛和统计性能问题。在本文中,我们提出了DSelect-k:一种基于新颖二进制编码公式的、连续可微且稀疏的MoE门控。该门控可以使用一阶方法(如随机梯度下降)进行训练,并对所选专家数量提供显式控制。我们在合成和真实MTL数据集(多达个任务)上展示了DSelect-k的有效性。我们的实验表明,与流行的MoE门控相比,DSelect-k在预测和专家选择上均能取得统计显著的改进。值得注意的是,在一个真实世界的大规模推荐系统上,DSelect-k相比Top-k在预测性能上实现了超过的提升。我们提供了DSelect-k的开源实现。
引用
@article{arxiv.2106.03760,
title = {DSelect-k: Differentiable Selection in the Mixture of Experts with Applications to Multi-Task Learning},
author = {Hussein Hazimeh and Zhe Zhao and Aakanksha Chowdhery and Maheswaran Sathiamoorthy and Yihua Chen and Rahul Mazumder and Lichan Hong and Ed H. Chi},
journal= {arXiv preprint arXiv:2106.03760},
year = {2022}
}
备注
Appeared in NeurIPS 2021