超越单一提取器:面向 LLM 预训练的 HTML 到文本提取重新思考
计算与语言
2026-02-24 v1 机器学习
摘要
构建大规模 LLM 预训练数据集的第一个预处理步骤涉及从 HTML 中提取文本。尽管网页内容呈现出巨大的多样性,但现有开源数据集主要对所有网页应用单一固定的提取器。在本工作中,我们调查了这种做法是否导致覆盖不足和数据利用效率低下。我们首先展示,尽管不同提取器在标准语言理解任务上可能导致相似的模型性能,但经过固定过滤流程后,剩余页面会大相径庇。这表明一种简单的方法:通过对不同提取器取联合,我们可在保持基准性能的同时,将 DCLM-Baseline 的 token产出提高最高可达 71%。我们进一步展示,对于结构化内容(如表格和代码块),提取器的选择对下游任务性能具有显著影响,在 WikiTQ 上差异可达最高 10 个百分点(p.p.),在 HumanEval 上差异可达 3 个百分点。
引用
@article{arxiv.2602.19548,
title = {Beyond a Single Extractor: Re-thinking HTML-to-Text Extraction for LLM Pretraining},
author = {Jeffrey Li and Josh Gardner and Doug Kang and Fangping Shi and Karanjeet Singh and Chun-Liang Li and Herumb Shandilya and David Hall and Oncel Tuzel and Percy Liang and Ludwig Schmidt and Hadi Pour Ansari and Fartash Faghri},
journal= {arXiv preprint arXiv:2602.19548},
year = {2026}
}