基于先验的噪声文本数据过滤:困惑度的快速且强大的替代方案
计算与语言
2026-03-04 v4
摘要
随着大型语言模型 (LLM) 在海量网络语料库上进行预训练,仔细选择数据对于确保有效和高效的学习变得至关重要。虽然基于困惑度 (PPL) 的过滤表现出强大的性能,但它存在缺点:在处理噪声或分布外样本时,存在大量时间成本和模型固有的不可靠性。在这项工作中,我们提出了一个简单而强大的替代方案:一种基于先验的数据过滤方法,它利用语料库级别的词频统计来估计 token 先验,其灵感来自于关于词角色和词汇密度的语言学见解。我们的方法基于 token 先验的均值和标准差过滤文档,作为 PPL 的快速代理,同时不需要模型推理。尽管很简单,基于先验的过滤器在 20 个下游基准测试中取得了最高的平均性能,同时与基于 PPL 的过滤相比减少了超过 1000 倍的时间成本。我们进一步展示了它对代码和数学等符号语言的适用性,以及它在无监督情况下对多语言语料库的动态适应性。
引用
@article{arxiv.2509.18577,
title = {Prior-based Noisy Text Data Filtering: Fast and Strong Alternative For Perplexity},
author = {Yeongbin Seo and Gayoung Kim and Jaehyung Kim and Jinyoung Yeo},
journal= {arXiv preprint arXiv:2509.18577},
year = {2026}
}
备注
ICLR 2026