SomaliWeb v1:一个质量过滤的索马里语网络语料库及配套分词器与公开语言识别基准
计算与语言
2026-05-19 v1 人工智能
信息检索
摘要
索马里语是非洲之角的一种库希特语,拥有约 2500 万使用者,但至今没有公开发布过带有配套分词器和语言识别基准的专用索马里语预训练语料库。现有的索马里语文本要么出现在多语言分布中(HPLT v2、CC100、MADLAD-400、OSCAR、mC4),要么作为 Hugging Face 上小规模、无文档记录的纯索马里语上传。我们引入了 SomaliWeb v1,这是一个包含 819,322 篇文档(约 303M tokens)的质量过滤索马里语语料库,通过六阶段可复现流程从三个上游来源(HPLT v2、CC100、索马里语维基百科)构建而成。我们发布了 该语料库、配套的 BPE-16K 分词器,以及 首个针对三种生产级语言识别器的并排公开索马里语基准。我们的测量揭示了现有分布中存在的具体质量缺陷:HPLT v2 的“已清洗”索马里语版本保留了 17.3% 的字节精确重复项,56.1% 的文档包含可修复的乱码,且在 Jaccard 下,10.7% 的字节唯一文档为近似重复项。我们的 BPE-16K 分词器在 FLORES-200 索马里语 devtest 上作为分词器级别的测量,比 GPT-4 的 cl100k_base 产生的 token 少 40.2%;下游语言模型困惑度比较留待后续版本发布。
引用
@article{arxiv.2605.18232,
title = {SomaliWeb v1: A Quality-Filtered Somali Web Corpus with a Matched Tokenizer and a Public Language-Identification Benchmark},
author = {Khalid Yusuf Dahir},
journal= {arXiv preprint arXiv:2605.18232},
year = {2026}
}
备注
16 pages, 6 figures, 6 tables. Code: https://github.com/khaledyusuf44/somali-corpus Dataset: https://huggingface.co/datasets/khaledyusuf44/somaliweb-v1