按需加载:多语言BERT的精简版本
计算与语言
2020-10-13 v1 人工智能
机器学习
摘要
基于Transformer的预训练模型在多种自然语言处理数据集上取得了最先进的结果。然而,这些模型的规模常成为其在真实生产应用中部署的弊端。对于多语言模型,大部分参数位于嵌入层。因此,减小词表规模应对参数总数产生重要影响。本文提出生成处理更少语言、依据目标语料的更小模型。我们给出了多语言BERT在XNLI数据集上的精简版本评估,但认为该方法可应用于其他多语言Transformer。所得结果证实,我们可以生成保持可比结果、同时将参数总数减少至多45%的更小模型。我们将我们的模型与DistilmBERT(多语言BERT的蒸馏版本)比较,表明与语言缩减不同,蒸馏在XNLI数据集上导致整体准确率下降1.7%至6%。所提供的模型与代码均已公开。
引用
@article{arxiv.2010.05609,
title = {Load What You Need: Smaller Versions of Multilingual BERT},
author = {Amine Abdaoui and Camille Pradel and Grégoire Sigel},
journal= {arXiv preprint arXiv:2010.05609},
year = {2020}
}