中文

Dripper:一种轻量级语言模型用于高效主 HTML 提取

计算与语言 2026-03-05 v2

摘要

从网页中提取高质量主内容是构建大规模训练语料库的关键前提。虽然传统的启发式提取器高效,但缺乏处理现代网页结构异质性所需的语义推理能力。相反,经过预训练的生成式大语言模型 (LLM) 具备优越的文件理解能力,但在大规模应用时受限于计算成本、上下文窗口受限以及幻觉风险。我们提出了 \textbf{Dripper},通过四项贡献解决了这些瓶颈:(1) 我们将提取任务重新表述为 \textbf{受约束序列标注} 任务,使用小型语言模型 (SLM)。该范式消除生成式幻觉,实现卓越的效率,在单张 A100 GPU 上达到 3.08 页/秒的吞吐量。(2) 我们构建了 \textbf{WebMainBench},一个严格的基准,包含 7,809 份人工标注页面,覆盖 5,434 个独特域名和多种语言。我们的 Dripper-0.6B 模型 \textbf{超过} 启发式方法如 Trafilatura,也与 DeepSeek-V3.2(685B)、GPT-5 和 Gemini-2.5-Pro 相媲美,在效率与准确性之间提供了最佳权衡。(3) 我们通过 \textbf{在 Dripper 精选语料库上预训练 1B 参数模型} 来展示其基础设施价值。该模型在下游任务中显著优于基线,证明提取质量和框架有效性的关键作用。(4) 我们 \textbf{开源} Dripper-0.6B 的模型权重和代码,以便构建高质量数据集。

关键词

引用

@article{arxiv.2511.23119,
  title  = {Dripper: Token-Efficient Main HTML Extraction with a Lightweight LM},
  author = {Mengjie Liu and Jiahui Peng and Wenchang Ning and Pei Chu and Jiantao Qiu and Ren Ma and He Zhu and Rui Min and Lindong Lu and Linfeng Hou and Kaiwen Liu and Yuan Qu and Zhenxiang Li and Chao Xu and Zhongying Tu and Wentao Zhang and Conghui He},
  journal= {arXiv preprint arXiv:2511.23119},
  year   = {2026}
}