模板检测与内容提取的基准测试套件
信息检索
2022-07-19 v5
摘要
模板检测和内容提取是应用于 Web 的信息检索的两个主要领域。它们对网页的结构和内容执行不同的分析以提取文档的某一部分,但其目标不同。模板检测识别网页的模板(通常通过与同一网站的其他网页进行比较),而内容提取则识别网页的主要内容并丢弃其他部分。因此,它们在某种程度上是互补的,因为主要内容不属于模板的一部分。据测量,模板占 Web 上数据的 40% 到 50%。因此,识别模板对于索引任务至关重要,因为模板通常包含广告、菜单和横幅等无关信息。处理和存储这些信息可能会导致资源(存储空间、带宽等)的浪费。同样,识别主要内容对于许多信息检索任务也至关重要。在本文中,我们提出了一套基准测试套件,用于测试模板检测和内容提取的不同方法。该套件是公开的,包含已标记的真实异构网页,以便适合(并自动)比较不同的技术。
引用
@article{arxiv.1409.6182,
title = {A Benchmark Suite for Template Detection and Content Extraction},
author = {Julián Alarte and Josep Silva},
journal= {arXiv preprint arXiv:1409.6182},
year = {2022}
}
备注
13 pages, 3 tables