中文

Fineweb-Edu-Ar:支持阿拉伯语小语言模型的机器翻译语料库

计算与语言 2024-11-12 v1 人工智能

摘要

随着大型语言模型(LLMs)的发展和成长,其数据需求也在增长。这对于多语言LLMs尤其如此,在这些模型中,高质量且易于获取的在线数据的稀缺导致了大量合成数据集生成方法的出现。这一领域的关键技术是机器翻译(MT),其中高质量英文文本被适配到目标相对低资源语言。本报告介绍了FineWeb-Edu-Ar,这是HuggingFace上极受欢迎的(去重后的)FineWeb-Edu数据集的机器翻译版本。据我们所知,FineWeb-Edu-Ar是最大的公开可用的机器翻译阿拉伯语数据集,其大小为202B tokens(使用阿拉伯语训练的分词器)。

关键词

引用

@article{arxiv.2411.06402,
  title  = {Fineweb-Edu-Ar: Machine-translated Corpus to Support Arabic Small Language Models},
  author = {Sultan Alrashed and Dmitrii Khizbullin and David R. Pugh},
  journal= {arXiv preprint arXiv:2411.06402},
  year   = {2024}
}