面向移动端实时 BERT 应用的压缩-编译协同设计框架
机器学习
2021-06-08 v2 人工智能
摘要
基于 Transformer 的深度学习模型已在许多自然语言处理(NLP)任务上日益展现出高精度。本文提出一种压缩-编译协同设计框架,能够保证所确定的模型满足移动设备的资源与实时性指标。我们的框架采用编译器感知的神经架构优化方法(CANAO),可生成在精度与延迟之间取得平衡的最优压缩模型。与 TensorFlow-Lite 相比,我们能够实现高达 7.8 倍的加速,且仅带来微小的精度损失。我们展示了移动设备上的两类 BERT 应用:问答(QA)与文本生成。两者均可以低至 45ms 的延迟实时运行。展示该框架的视频可在 https://www.youtube.com/watch?v=_WIRvK_2PZI 查看。
引用
@article{arxiv.2106.00526,
title = {A Compression-Compilation Framework for On-mobile Real-time BERT Applications},
author = {Wei Niu and Zhenglun Kong and Geng Yuan and Weiwen Jiang and Jiexiong Guan and Caiwen Ding and Pu Zhao and Sijia Liu and Bin Ren and Yanzhi Wang},
journal= {arXiv preprint arXiv:2106.00526},
year = {2021}
}
备注
arXiv admin note: substantial text overlap with arXiv:2009.06823