正文抽取对近似重复检测的影响
信息检索
2021-11-23 v1
摘要
商业网络搜索引擎采用近似重复检测,以确保用户每次只看到每个相关结果一次,尽管底层的网络爬取通常包含许多网页的(近似)重复。我们以信息检索为视角重新审视近似重复的风险与潜力,论证当前建立开放且独立的欧洲网络搜索基础设施的努力应在其索引中维护关于重复与近似重复文档的元数据。在开放网络搜索基础设施中实现的近似重复检测应提供合适的相似度阈值,这是一个困难的选择,因为相同的页面可能在对于搜索者无关的部分(模板、广告等)存在显著差异。我们通过比较 ClueWeb 爬取上两项研究中五种(正文)内容抽取方法的页面相似度来研究此问题。我们发现,页面的完整内容服务于面向精度的近似重复检测,而正文抽取则更面向召回。
引用
@article{arxiv.2111.10864,
title = {The Impact of Main Content Extraction on Near-Duplicate Detection},
author = {Maik Fröbe and Matthias Hagen and Janek Bevendorff and Michael Völske and Benno Stein and Christopher Schröder and Robby Wagner and Lukas Gienapp and Martin Potthast},
journal= {arXiv preprint arXiv:2111.10864},
year = {2021}
}