中文

基于神经网页抓取的更纯净预训练语料库构建

计算与语言 2024-06-18 v3

摘要

网络包含大规模、多样且丰富的信息,能够满足人类的信息检索需求。通过精细的数据收集、预处理与整理,网页可作为语言模型预训练的基础数据资源。然而,面对日益革新且复杂的网页结构,基于规则/特征的网页抓取器愈发显得力不从心。本文提出了一种简单、快速且有效的神经网页抓取器(NeuScraper),以辅助从网页中提取主要且纯净的文本内容。实验结果表明,NeuScraper 超越了基线抓取器,取得了超过 20% 的提升,展现了其在提取更高质量数据以促进语言模型预训练方面的潜力。所有代码均可在 https://github.com/OpenMatch/NeuScraper 获取。

关键词

引用

@article{arxiv.2402.14652,
  title  = {Cleaner Pretraining Corpus Curation with Neural Web Scraping},
  author = {Zhipeng Xu and Zhenghao Liu and Yukun Yan and Zhiyuan Liu and Ge Yu and Chenyan Xiong},
  journal= {arXiv preprint arXiv:2402.14652},
  year   = {2024}
}