中文

Fundus:一款针对高质量提取优化的易用新闻抓取器

计算与语言 2024-06-25 v2 信息检索

摘要

本文介绍了 Fundus,一款用户友好的新闻抓取器,使用户仅需几行代码即可获取数百万篇高质量新闻文章。与现有新闻抓取器不同,我们使用手工制作、定制的內容提取器,这些提取器专门针对每个受支持的在线报纸的格式指南量身打造。这使我们能够优化抓取质量,从而检索到的新闻文章文本完整且不含 HTML 伪影。此外,我们的框架将爬取(从网络或大型网络存档中检索 HTML)和内容提取合并到一个单一的流水线中。通过为预定义的报纸集合提供统一接口,我们旨在使 Fundus 甚至能被非技术用户广泛使用。本文概述了该框架,讨论了我们的设计选择,并与其他流行的新闻抓取器进行了比较评估。我们的评估表明,Fundus 产生的提取质量(完整且无伪影的新闻文章)显著高于先前的工作。该框架可在 GitHub 上获取,地址为 https://github.com/flairNLP/fundus,并可使用 pip 简单安装。

关键词

引用

@article{arxiv.2403.15279,
  title  = {Fundus: A Simple-to-Use News Scraper Optimized for High Quality Extractions},
  author = {Max Dallabetta and Conrad Dobberstein and Adrian Breiding and Alan Akbik},
  journal= {arXiv preprint arXiv:2403.15279},
  year   = {2024}
}

备注

10 pages, 4 figures, ACL 2024, for a screencast see https://www.youtube.com/watch?v=9GJExMelhdI