RobBERTje:一个蒸馏的荷兰语 BERT 模型
计算与语言
2022-04-29 v1
摘要
诸如 BERT 的预训练大规模语言模型因其在广泛自然语言任务上的出色表现而备受关注。然而,由于其大量参数,它们在部署和微调上均耗费资源。研究者已提出多种将语言模型蒸馏为更小模型以提高效率的方法,代价是轻微的性能折损。在本文中,我们创建了最先进的荷兰语 RobBERT 模型的若干不同蒸馏版本,并称之为 RobBERTje。这些蒸馏区别在于其蒸馏语料,即它们是否被打乱以及是否与后续句子合并。我们发现,对大多数任务而言,使用打乱与非打乱数据集的模型性能相似,且随机合并语料中后续句子所创建的模型训练更快并在长序列任务上表现更好。在比较蒸馏架构时,我们发现较大的 DistilBERT 架构显著优于 Bort 超参数化。有趣的是,我们还发现蒸馏模型展现的性别刻板偏见少于其教师模型。由于更小的架构减少了微调时间,这些模型允许对许多荷兰语下游语言任务进行更高效的训练和更轻量的部署。
引用
@article{arxiv.2204.13511,
title = {RobBERTje: a Distilled Dutch BERT Model},
author = {Pieter Delobelle and Thomas Winters and Bettina Berendt},
journal= {arXiv preprint arXiv:2204.13511},
year = {2022}
}
备注
Published in CLIN journal