中文

基于先验的噪声文本数据过滤:困惑度的快速且强大的替代方案

计算与语言 2026-03-04 v4

摘要

随着大型语言模型 (LLM) 在海量网络语料库上进行预训练,仔细选择数据对于确保有效和高效的学习变得至关重要。虽然基于困惑度 (PPL) 的过滤表现出强大的性能,但它存在缺点:在处理噪声或分布外样本时,存在大量时间成本和模型固有的不可靠性。在这项工作中,我们提出了一个简单而强大的替代方案:一种基于先验的数据过滤方法,它利用语料库级别的词频统计来估计 token 先验,其灵感来自于关于词角色和词汇密度的语言学见解。我们的方法基于 token 先验的均值和标准差过滤文档,作为 PPL 的快速代理,同时不需要模型推理。尽管很简单,基于先验的过滤器在 20 个下游基准测试中取得了最高的平均性能,同时与基于 PPL 的过滤相比减少了超过 1000 倍的时间成本。我们进一步展示了它对代码和数学等符号语言的适用性,以及它在无监督情况下对多语言语料库的动态适应性。

关键词

引用

@article{arxiv.2509.18577,
  title  = {Prior-based Noisy Text Data Filtering: Fast and Strong Alternative For Perplexity},
  author = {Yeongbin Seo and Gayoung Kim and Jaehyung Kim and Jinyoung Yeo},
  journal= {arXiv preprint arXiv:2509.18577},
  year   = {2026}
}

备注

ICLR 2026