中文

从维基数据转储到训练语料库:南斯拉夫语支案例

计算与语言 2026-05-18 v2

摘要

本文提出了一个流水线,旨在将原始的 Wikimedia 数据转储转化为七种南斯拉夫语支的高质量文本语料库。该工作分为两个主要阶段。第一阶段涉及从 Wikipedia、Wikisource、Wikibooks、Wikinews 和 Wikiquote 的原始数据转储中提取并清洗文本。这一步骤需要谨慎处理原始维基标记,以首先分离出文本文章,随后提取其中可用的自然语言文本。第二阶段处理可疑或低质量文章的挑战,这些文章通常由数据库或结构化知识库生成。此类文章的特征是具有重复模式、通用措辞以及极少甚至没有原创内容。为减轻其影响,本文采用基于 n-gram 的过滤策略,检测文章间的高文本冗余,并随后将这些文章从语料库中完全移除。最终生成的数据集旨在提供语言内容丰富的文本,适用于训练语言模型或开展跨南斯拉夫语支的比较研究。通过将系统性提取与质量控制相结合,本工作有助于构建可靠、高信息量且反映语言真实文化语境的语料库。尽管本文聚焦于南斯拉夫语支案例,该方法在很大程度上是语言无关的,并可推广至其他语言。

关键词

引用

@article{arxiv.2604.25384,
  title  = {Wiki Dumps to Training Corpora: South Slavic Case},
  author = {Mihailo Škorić and Cosimo Palma},
  journal= {arXiv preprint arXiv:2604.25384},
  year   = {2026}
}