中文

用于高效语言建模的MicroNet

计算与语言 2020-05-19 v1 机器学习

摘要

设计紧凑的语言模型以实现高效部署十分重要。我们在语言建模领域和模型压缩领域的近期进展基础上进行改进,构建了参数与计算高效的语言模型。我们使用了一种高效的基于Transformer的架构,具有自适应嵌入与softmax、可微分非参数缓存、Hebbian softmax、知识蒸馏、网络剪枝和低比特量化。本文中,我们提供了NeurIPS 2019 MicroNet Challenge语言建模赛道的获胜方案。与MicroNet Challenge提供的基线语言模型相比,我们的模型参数效率高90倍、计算效率高36倍,同时在Wikitext-103数据集上达到了要求的35测试困惑度。我们希望该工作能有助于未来对高效语言模型的研究,并且我们已在https://github.com/mit-han-lab/neurips-micronet发布了完整源代码。

关键词

引用

@article{arxiv.2005.07877,
  title  = {MicroNet for Efficient Language Modeling},
  author = {Zhongxia Yan and Hanrui Wang and Demi Guo and Song Han},
  journal= {arXiv preprint arXiv:2005.07877},
  year   = {2020}
}

备注

Accepted by PMLR