移动端大规模语言模型的实时执行
计算与语言
2020-10-23 v2 机器学习
摘要
预训练大规模语言模型已在众多自然语言处理(NLP)任务上展现出日益提升的高准确率。然而,硬件平台上有限的权重存储与计算速度阻碍了预训练模型的普及,尤其在边缘计算时代。本文中,我们寻求为给定计算规模找到 BERT 的最佳模型结构以匹配特定设备。我们提出首个编译器感知的神经架构优化框架。我们的框架能保证所确定的模型满足移动设备的资源与实时规格,从而实现基于大型 transformer 的模型(如 BERT 变体)的实时执行。我们在若干 NLP 任务上评估我们的模型,在知名基准上以移动设备更低延迟取得了具竞争力的结果。具体而言,与 BERT-base 相比,我们的模型在 CPU 上快 5.2 倍、在 GPU 上快 4.1 倍,且精度损失仅 0.5-2%。与 TensorFlow-Lite 相比,我们的整体框架实现了高达 7.8 倍的加速,且仅有微小精度损失。
引用
@article{arxiv.2009.06823,
title = {Real-Time Execution of Large-scale Language Models on Mobile},
author = {Wei Niu and Zhenglun Kong and Geng Yuan and Weiwen Jiang and Jiexiong Guan and Caiwen Ding and Pu Zhao and Sijia Liu and Bin Ren and Yanzhi Wang},
journal= {arXiv preprint arXiv:2009.06823},
year = {2020}
}