中文

SqueezeBERT:计算机视觉能为 NLP 的高效神经网络带来什么启示?

计算与语言 2020-06-23 v1 计算机视觉与模式识别 机器学习

摘要

人类每天读写数千亿条消息。此外,由于大型数据集、大型计算系统以及更优的神经网络模型的可用性,自然语言处理(NLP)技术在理解、校对和组织这些消息方面取得了重大进展。因此,存在显著机会将 NLP 部署于无数应用中,以帮助网络用户、社交网络和企业。我们尤其将智能手机及其他移动设备视为大规模部署 NLP 模型的关键平台。然而,当今高度准确的 NLP 神经网络模型如 BERT 和 RoBERTa 计算开销极大,BERT-base 在 Pixel 3 智能手机上分类一段文本需耗时 1.7 秒。本工作中,我们观察到分组卷积等方法已为计算机视觉网络带来显著加速,但这些技术许多尚未被 NLP 神经网络设计者采用。我们展示了如何将自注意力层中的若干操作替换为分组卷积,并将该技术在名为 SqueezeBERT 的新型网络架构中使用,其在 Pixel 3 上比 BERT-base 快 4.3 倍,同时在 GLUE 测试集上取得具竞争力的准确率。SqueezeBERT 代码将会发布。

关键词

引用

@article{arxiv.2006.11316,
  title  = {SqueezeBERT: What can computer vision teach NLP about efficient neural networks?},
  author = {Forrest N. Iandola and Albert E. Shaw and Ravi Krishna and Kurt W. Keutzer},
  journal= {arXiv preprint arXiv:2006.11316},
  year   = {2020}
}

备注

9 pages + appendix