SWEb:面向斯堪的纳维亚语言的大规模网页数据集
计算与语言
2024-10-08 v1
摘要
本文介绍了迄今为止面向斯堪的纳维亚语言(斯堪的纳维亚语)最大的预训练数据集:Scandinavian WEb(SWEb),包含超过一万亿个标记。本文详细阐述了数据集的收集与处理流程,并引入了一种新颖的基于模型的文本提取器,显著降低了与基于规则的方法相比的复杂度。我们还引入了一种新的遮盖式基准测试,用于评估瑞典语语言模型的性能,并通过该测试比较了在SWEb数据上训练的模型与在FineWeb上训练的模型,结果显示两者表现相当。所有数据、模型和代码均已公开共享。
引用
@article{arxiv.2410.04456,
title = {SWEb: A Large Web Dataset for the Scandinavian Languages},
author = {Tobias Norlund and Tim Isbister and Amaru Cuba Gyllensten and Paul Dos Santos and Danila Petrelli and Ariel Ekgren and Magnus Sahlgren},
journal= {arXiv preprint arXiv:2410.04456},
year = {2024}
}