中文

WangchanBERTa:基于Transformer的泰语语言模型预训练

计算与语言 2021-03-23 v2

摘要

基于Transformer的语言模型,更具体地说是基于BERT的架构,在许多下游任务中取得了最先进的性能。然而,对于泰语这种相对低资源的语言,模型的选择仅限于基于小得多的数据集训练基于BERT的模型,或微调多语言模型,这两种方法都产生次优的下游性能。此外,大规模多语言预训练未考虑泰语特定的语言特征。为克服这些限制,我们基于RoBERTa-base架构,在一个大规模、去重、清洗的训练集(总规模78GB)上预训练语言模型,该训练集精选自社交媒体帖子、新闻文章和其他公开可用的多样领域数据集。我们应用了泰语特定的文本处理规则,最重要的是在子词分词前保留空格,而空格在泰语中是重要的词块和句子边界。我们还在较小数据集上实验了词级、音节级和SentencePiece分词,以探索分词对下游性能的影响。我们在78.5GB数据集上训练的模型wangchanberta-base-att-spm-uncased在人工标注的单语语境下的序列分类和词元分类任务中,均优于强基线(NBSVM、CRF和ULMFit)和多语言模型(XLMR和mBERT)。

关键词

引用

@article{arxiv.2101.09635,
  title  = {WangchanBERTa: Pretraining transformer-based Thai Language Models},
  author = {Lalita Lowphansirikul and Charin Polpanumas and Nawat Jantrakulchai and Sarana Nutanong},
  journal= {arXiv preprint arXiv:2101.09635},
  year   = {2021}
}

备注

24 pages, edited the citation of the syllable-level tokenizer from [Chormai et al., 2020] to [Phatthiyaphaibun et al., 2020] as the authors used the syllable-level tokenizer from PyThaiNLP [Phatthiyaphaibun et al., 2020] in the experiments