中文

双重稀疏:基于稀疏专家混合的稀疏 softmax 高效推理

机器学习 2019-07-04 v2 机器学习

摘要

当输出类别数量很大时,softmax 函数的计算开销极为昂贵。本文提出一种新颖的 softmax 推理加速方法——双重稀疏 softmax(DS-Softmax),其利用稀疏专家混合来高效检索 top-k 类别。与大多数需要并近似固定 softmax 的现有方法不同,我们的方法基于学习,并能自适应 softmax 权重以获得更好的推理加速。具体而言,我们的方法学习一个两级层次结构,将整个输出类别空间划分为若干部分重叠的专家。每个专家都是稀疏的,仅包含输出类别的一个子集。为寻找 top-k 类别,稀疏混合使我们能够快速找到最可能专家,而稀疏专家使我们能在小规模 softmax 中搜索。我们在多个真实任务(包括神经机器翻译、语言建模和图像分类)上进行了实证评估,结果表明可在无性能损失的情况下实现显著的计算量削减。

关键词

引用

@article{arxiv.1901.10668,
  title  = {Doubly Sparse: Sparse Mixture of Sparse Experts for Efficient Softmax Inference},
  author = {Shun Liao and Ting Chen and Tian Lin and Denny Zhou and Chong Wang},
  journal= {arXiv preprint arXiv:1901.10668},
  year   = {2019}
}