边缘设备上量化Transformer语言模型的实现
计算与语言
2023-10-09 v1 硬件体系结构
摘要
基于Transformer的大规模模型(如Bidirectional Encoder Representations from Transformers (BERT))被广泛用于自然语言处理(NLP)应用,这些模型最初使用包含数百万参数的大型语料库进行预训练,然后针对下游NLP任务进行微调。这些大规模模型的主要局限之一在于,由于其庞大的模型规模和增加的推理延迟,无法部署在资源受限的设备上。为克服这些限制,此类大规模模型可转换为针对资源受限边缘设备部署优化的FlatBuffer格式。在此,我们评估了此类FlatBuffer转换的MobileBERT模型在三种不同边缘设备上的性能,这些模型在RepLab 2013数据集中针对英语推文的声誉分析进行了微调。此外,本研究包含对已部署模型的评估,其中对其延迟、性能和资源效率进行了细致考量。实验结果表明,与原始BERT large模型相比,转换并量化的MobileBERT模型在分析边缘设备上每秒至少一条推文时,足迹缩小了160,准确率仅下降4.1%。此外,我们的研究强调了TinyML系统的隐私保护特性,因为所有数据均在无服务器环境中本地处理。
引用
@article{arxiv.2310.03971,
title = {Quantized Transformer Language Model Implementations on Edge Devices},
author = {Mohammad Wali Ur Rahman and Murad Mehrab Abrar and Hunter Gibbons Copening and Salim Hariri and Sicong Shao and Pratik Satam and Soheil Salehi},
journal= {arXiv preprint arXiv:2310.03971},
year = {2023}
}
备注
Accepted for publication on 22nd International Conference of Machine Learning and Applications, ICMLA 2023