中文

面向俄语的预训练 Transformer 语言模型系列

计算与语言 2024-08-05 v4

摘要

Transformer 语言模型(LMs)是各种语言 NLP 研究方法与应用的基础。然而,专门针对俄语开发此类模型受到的关注甚少。本文介绍了一个包含 13 个俄语 Transformer LMs 的集合,涵盖编码器(ruBERT、ruRoBERTa、ruELECTRA)、解码器(ruGPT-3)以及编码器-解码器(ruT5、FRED-T5)架构。我们提供了关于模型架构设计与预训练的报告,以及它们在俄语理解与生成数据集和基准上泛化能力评估的结果。通过预训练并发布这些专门的 Transformer LMs,我们旨在拓展 NLP 研究方向的范围,并支持俄语工业解决方案的开发。

关键词

引用

@article{arxiv.2309.10931,
  title  = {A Family of Pretrained Transformer Language Models for Russian},
  author = {Dmitry Zmitrovich and Alexander Abramov and Andrey Kalmykov and Maria Tikhonova and Ekaterina Taktasheva and Danil Astafurov and Mark Baushenko and Artem Snegirev and Vitalii Kadulin and Sergey Markov and Tatiana Shavrina and Vladislav Mikhailov and Alena Fenogenova},
  journal= {arXiv preprint arXiv:2309.10931},
  year   = {2024}
}

备注

LREC-COLING-2024