UzBERT:面向乌兹别克语的 BERT 模型预训练
计算与语言
2021-08-24 v1
摘要
基于 Transformer 架构的预训练语言模型已在词性标注、命名实体识别和问答等各种自然语言处理任务中取得最先进的结果。然而,尚无此类乌兹别克语单语模型公开可用。在本文中,我们介绍了 UzBERT,一个基于 BERT 架构的乌兹别克语预训练语言模型。我们的模型在掩码语言模型准确率上大幅优于多语言 BERT。我们以 MIT 开源许可证公开提供该模型。
引用
@article{arxiv.2108.09814,
title = {UzBERT: pretraining a BERT model for Uzbek},
author = {B. Mansurov and A. Mansurov},
journal= {arXiv preprint arXiv:2108.09814},
year = {2021}
}
备注
9 pages, 1 table