超越行级过滤:大语言模型预训练语料的改进方法
计算与语言
2025-10-29 v1 人工智能
摘要
传统的行级过滤技术,如行级去重和尾随标点过滤器,常用于预训练语料,但这些基础方法有时会丢弃有价值的内容,影响下游性能。本文引入两种方法:模式感知行级去重(PLD)和模式感知尾随标点过滤(PTF),通过增强常规过滤技术实现。我们的做法不仅考虑行级信号,还考量其在文档中序列分布,能够保留结构性重要内容。我们通过在英语和韩语中训练小型语言模型(10亿参数)评估了这些方法。结果表明,我们的方法在多项选择基准测试中一致提升性能,并显著增强了在SQuAD v1和KorQuAD v1上的生成式问答准确率。
引用
@article{arxiv.2510.24139,
title = {Beyond Line-Level Filtering for the Pretraining Corpora of LLMs},
author = {Chanwoo Park and Suyoung Park and Yelim Ahn and Jongmin Kim and Jongyeon Park and Jaejin Lee},
journal= {arXiv preprint arXiv:2510.24139},
year = {2025}
}
备注
submitted to ACL ARR Rolling Review