中文

蒸馏 BERT 用于低复杂度网络训练

计算与语言 2021-05-17 v1 机器学习

摘要

本文研究了在 SST-2 数据集上利用情感分析将 BERT 的学习迁移至 BiLSTM、带注意力的 BiLSTM 以及浅层 CNN 等低复杂度模型的效率。同时比较了 BERT 模型与这些低复杂度模型的推理复杂度,并强调了这些技术在使移动设备、平板电脑以及 Raspberry Pi 等 MCU 开发板等边缘设备上运行高性能 NLP 模型并实现令人振奋的新应用方面的重要性。

关键词

引用

@article{arxiv.2105.06514,
  title  = {Distilling BERT for low complexity network training},
  author = {Bansidhar Mangalwedhekar},
  journal= {arXiv preprint arXiv:2105.06514},
  year   = {2021}
}