HerBERT:面向波兰语的高效预训练基于 Transformer 的语言模型
计算与语言
2021-05-06 v1 机器学习
摘要
基于 BERT 的模型目前被用于解决几乎所有自然语言处理(NLP)任务,且多数情况下取得最先进结果。因此,NLP 界对这些模型开展了广泛研究,但首要任务是设计有效且高效的训练流程。已有若干针对如何训练类 BERT 模型的消融研究,但其中绝大多数仅涉及英语。为英语设计的训练流程未必具有普适性,也未必适用于其他尤其是类型学上不同的语言。因此,本文呈现了首个聚焦于波兰语的消融研究,波兰语与孤立语的英语不同,是一种屈折语。我们设计并细致评估了从多语言类 BERT 模型向单语言模型迁移知识的预训练流程。除多语言模型初始化外,还探究了其他可能影响预训练的因素,即训练目标、语料规模、BPE-Dropout 与预训练时长。基于所提流程,训练了波兰语基于 BERT 的语言模型——HerBERT。该模型在多个下游任务上取得了最先进结果。
引用
@article{arxiv.2105.01735,
title = {HerBERT: Efficiently Pretrained Transformer-based Language Model for Polish},
author = {Robert Mroczkowski and Piotr Rybak and Alina Wróblewska and Ireneusz Gawlik},
journal= {arXiv preprint arXiv:2105.01735},
year = {2021}
}
备注
Published in Proceedings of the 8th Workshop on Balto-Slavic Natural Language Processing