中文

模板检测与内容提取的基准测试套件

信息检索 2022-07-19 v5

摘要

模板检测和内容提取是应用于 Web 的信息检索的两个主要领域。它们对网页的结构和内容执行不同的分析以提取文档的某一部分,但其目标不同。模板检测识别网页的模板(通常通过与同一网站的其他网页进行比较),而内容提取则识别网页的主要内容并丢弃其他部分。因此,它们在某种程度上是互补的,因为主要内容不属于模板的一部分。据测量,模板占 Web 上数据的 40% 到 50%。因此,识别模板对于索引任务至关重要,因为模板通常包含广告、菜单和横幅等无关信息。处理和存储这些信息可能会导致资源(存储空间、带宽等)的浪费。同样,识别主要内容对于许多信息检索任务也至关重要。在本文中,我们提出了一套基准测试套件,用于测试模板检测和内容提取的不同方法。该套件是公开的,包含已标记的真实异构网页,以便适合(并自动)比较不同的技术。

关键词

引用

@article{arxiv.1409.6182,
  title  = {A Benchmark Suite for Template Detection and Content Extraction},
  author = {Julián Alarte and Josep Silva},
  journal= {arXiv preprint arXiv:1409.6182},
  year   = {2022}
}

备注

13 pages, 3 tables