中文

1500 亿罗马尼亚语语料库用于语言模型预训练

计算与语言 2024-07-19 v1

摘要

语言模型的研究正在迅速发展,许多开放模型已发布。开放可获得的预训练语料库通常只聚焦于少数几种语言,而其他许多语言要么完全缺失,要么严重不足。本报告介绍了从 CommonCrawl 中提取的 1500 亿罗马尼亚语语料库 FuLG。我们呈现了对 FuLG 的过滤方法,并通过消融研究将其与现有的罗马尼亚语语料库进行比较。

关键词

引用

@article{arxiv.2407.13657,
  title  = {FuLG: 150B Romanian Corpus for Language Model Pretraining},
  author = {Vlad-Andrei Bădoiu and Mihai-Valentin Dumitru and Alexandru M. Gherghescu and Alexandru Agache and Costin Raiciu},
  journal= {arXiv preprint arXiv:2407.13657},
  year   = {2024}
}