TiBERT:藏语预训练语言模型
计算与语言
2022-05-17 v1 人工智能
摘要
预训练语言模型在大规模无标注文本上进行训练,能够在许多不同的下游任务中取得最先进的(state-of-the-art, SOTA)结果。然而,当前的预训练语言模型主要集中在中文和英文领域。对于藏语等低资源语言,缺乏单语预训练模型。为推动藏语自然语言处理任务的发展,本文从藏语网站收集大规模训练数据,并利用 Sentencepiece 构建了一个能够覆盖语料中 99.95 词汇的词表。随后,我们基于该数据和词表训练了名为 TiBERT 的藏语单语预训练语言模型。最后,我们将 TiBERT 应用于文本分类和问答生成下游任务,并与经典模型及多语预训练模型进行比较,实验结果表明 TiBERT 能够取得最佳性能。我们的模型发布于 http://tibert.cmli-nlp.com/
引用
@article{arxiv.2205.07303,
title = {TiBERT: Tibetan Pre-trained Language Model},
author = {Yuan Sun and Sisi Liu and Junjie Deng and Xiaobing Zhao},
journal= {arXiv preprint arXiv:2205.07303},
year = {2022}
}