中文

AICC: 更细致地解析 HTML,提升模型表现 —— 由基于模型的 HTML 解析器构建的 7.3 万亿 Token AI 就绪语料库

计算与语言 2025-11-27 v2

摘要

虽然网页数据质量对大语言模型至关重要,但大多数数据清洗工作侧重于过滤和去重,将 HTML 转文本的提取视为固定的预处理步骤。现有的网页语料库依赖基于启发式的方法如 Trafilatura 等提取器,难以保留文档结构,频繁损坏公式、代码和表格等结构化元素。我们假设,提高提取质量与激进的过滤策略同等对下游性能产生影响。我们引入 MinerU-HTML,这是一套新颖的提取管道,将内容提取问题 reformulated 为由 0.6B 参数语言模型求解的序列标注问题。不同于文本密度启发式方法,MinerU-HTML 利用语义理解,并采用两阶段格式化管道,在转换为 Markdown 之前显式地对语义元素进行分类。关键在于,其基于模型的方法具有内在可扩展性,而启发式方法的改进路径有限。在我们的基准测试 MainWebBench 上,该基准包含 7,887 个标注网页,MinerU-HTML 实现了 81.8% 的 ROUGE-N F1 分数,远高于 Trafilatura 的 63.6%,在结构化元素保留方面表现卓越(代码块 90.9%,公式 94.0%)。使用 MinerU-HTML,我们构建了 AICC(AI-ready Common Crawl),从两个 Common Crawl 快照中构建了 7.3 万亿 Token 的多语言语料库。在受控预训练实验中,AICC 和 Trafilatura 提取的 TfCC 采用相同的过滤方式,训练于 AICC(620 亿 Token)的模型在 13 个基准测试上实现了 50.8% 的平均准确率,超越 TfCC 1.08 个百分点——这直接证明了提取质量对模型能力具有显著影响。AICC 还在关键基准测试上超越了 RefinedWeb 和 FineWeb。我们公开发布了 MainWebBench、MinerU-HTML 和 AICC,表明 HTML 提取是网页语料库构建中的关键且常被低估的组成部分。

关键词

引用

@article{arxiv.2511.16397,
  title  = {AICC: Parse HTML Finer, Make Models Better -- A 7.3T AI-Ready Corpus Built by a Model-Based HTML Parser},
  author = {Ren Ma and Jiantao Qiu and Chao Xu and Pei Chu and Kaiwen Liu and Pengli Ren and Yuan Qu and Jiahui Peng and Linfeng Hou and Mengjie Liu and Lindong Lu and Wenchang Ning and Jia Yu and Rui Min and Jin Shi and Haojiong Chen and Peng Zhang and Wenjian Zhang and Qian Jiang and Zengjie Hu and Guoqiang Yang and Zhenxiang Li and Fukai Shang and Runyuan Ma and Chenlin Su and Zhongying Tu and Wentao Zhang and Dahua Lin and Conghui He},
  journal= {arXiv preprint arXiv:2511.16397},
  year   = {2025}
}