中文

FineFreq:来自 Web 规模文本的多语言字符频率数据集

计算与语言 2025-12-29 v2

摘要

我们提出 FineFreq,一个来自 FineWeb 和 FineWeb2 语料库的大规模多语言字符频率数据集,覆盖超过 1900 种语言,跨越 2013-2025 年。数据集包含来自 57 TB 压缩文本的 96 万亿个字符的频率计数。对于每种语言,FineFreq 提供逐字符统计,包含聚合和年份级别的频率,允许进行细粒度的时间分析。数据集保留了自然出现的多语言特征,如跨脚本借词、emoji 和缩写词,无需人工过滤。每个字符条目包括 Unicode 元数据(类别、脚本、块),可用于特定领域或其他下游过滤和分析。数据集以 CSV 和 Parquet 两种格式发布,附带关联元数据,可在 GitHub 和 HuggingFace 上获取。https://github.com/Bin-2/FineFreq

关键词

引用

@article{arxiv.2512.09701,
  title  = {FineFreq: A Multilingual Character Frequency Dataset from Web-Scale Text},
  author = {Binbin Xu},
  journal= {arXiv preprint arXiv:2512.09701},
  year   = {2025}
}