中文

Matina:一个大型730亿标记的波斯文本语料库

计算与语言 2025-02-14 v1 人工智能

摘要

文本语料库是训练用于摘要、翻译和大型语言模型(LLM)等任务中所必需的模型。虽然已对许多语言制作了单语和多语言数据集,但波斯语常因数据收集和预处理资源有限而被低估。现有的波斯语数据集通常规模较小,缺乏内容多样性,主要由网页日志和新闻文章组成。这种高质量、多样化数据的不足减缓了NLP模型和开源LLM为波斯语的发展。由于模型性能高度依赖训练数据的质量,我们通过引入Matina语料库来弥补这一差距,这是一个新的波斯语数据集,包含729亿标记,经过仔细的预处理和去重,以确保高数据质量。我们进一步通过在关键NLP任务上训练和评估基于变换器的模型来评估其有效性。该数据集和预处理代码公开可用,为未来的波斯语NLP进步提供了可构建和改进的资源。

关键词

引用

@article{arxiv.2502.09188,
  title  = {Matina: A Large-Scale 73B Token Persian Text Corpus},
  author = {Sara Bourbour Hosseinbeigi and Fatemeh Taherinezhad and Heshaam Faili and Hamed Baghbani and Fatemeh Nadi and Mostafa Amiri},
  journal= {arXiv preprint arXiv:2502.09188},
  year   = {2025}
}