中文

FaBERT:在波斯语博客上预训练的 BERT

计算与语言 2024-02-12 v1

摘要

我们推出了 FaBERT,这是一种在 HmBlogs 语料库上预训练的波斯语 BERT-base 模型,该语料库涵盖了非正式和正式的波斯语文本。FaBERT 旨在在传统自然语言理解 (NLU) 任务中表现出色,解决波斯语中普遍存在的多样化句子结构和语言风格的复杂性。我们在 12 个数据集上对 FaBERT 进行了全面评估,涵盖情感分析 (SA)、命名实体识别 (NER)、自然语言推理 (NLI)、问答 (QA) 和问题改写 (QP) 等各种下游任务,结果表明其在紧凑的模型规模下始终表现出性能提升。研究结果强调了利用多样且经过清洗的语料库(如 HmBlogs)来提升 BERT 等语言模型在波斯语自然语言处理 (NLP) 应用中性能的重要性。FaBERT 已在 https://huggingface.co/sbunlp/fabert 公开获取。

关键词

引用

@article{arxiv.2402.06617,
  title  = {FaBERT: Pre-training BERT on Persian Blogs},
  author = {Mostafa Masumi and Seyed Soroush Majd and Mehrnoush Shamsfard and Hamid Beigy},
  journal= {arXiv preprint arXiv:2402.06617},
  year   = {2024}
}