MicroBERT:通过参数缩减与多任务学习有效训练低资源单语BERT
计算与语言
2023-01-06 v2
摘要
Transformer语言模型(TLM)对大多数NLP任务至关重要,但由于所需预训练数据量巨大,难以为低资源语言构建。本文研究了在低资源环境下训练单语TLM的两种技术:大幅缩减TLM规模,以及用两个语言信息丰富的监督任务(词性标注与依存句法分析)补充掩码语言建模目标。来自7种不同语言的结果表明,我们的模型MicroBERT相较于典型的单语TLM预训练方法,能在下游任务评测中取得显著改进。具体而言,我们发现单语MicroBERT模型在解析器LAS上较多语言基线mBERT提升高达18%,在NER F1上提升11%,而参数量不足其1%。我们得出结论:降低TLM参数量并使用标注数据预训练低资源TLM可带来巨大的质量收益,且在某些情况下能产出优于多语言方法的模型。
引用
@article{arxiv.2212.12510,
title = {MicroBERT: Effective Training of Low-resource Monolingual BERTs through Parameter Reduction and Multitask Learning},
author = {Luke Gessler and Amir Zeldes},
journal= {arXiv preprint arXiv:2212.12510},
year = {2023}
}
备注
Presented at MRL at EMNLP 2022 in Abu Dhabi. Code at https://github.com/lgessler/microbert and models at https://huggingface.co/lgessler