中文

用于网页浏览器中模板内容移除的相关图像提取

信息检索 2020-01-15 v2

摘要

模板内容指网页中令人分心于阅读核心内容(如新闻文章)的不必要且重复的部分(如广告或目录)。准确检测并移除网页中的模板内容可使用户获得无杂乱的网页或新闻文章视图。这在网页浏览器中的阅读模式等特性中颇有用途。当前 Firefox、Chrome 和 Edge 等网页浏览器中阅读模式的实现对于网页文本内容表现尚佳。然而它们大多基于启发式且当网页内容动态时缺乏灵活性。并且它们常不能很好地移除网页中以图像与多媒体形式存在的模板内容。对于模板图像的检测,需知晓图像在网页中的实际布局,这唯有在网页被渲染时才可能。本文我们讨论相关图像提取中的若干问题。我们还呈现了一个测试框架的设计以度量准确性,以及一种通过利用可提供图像渲染信息的无头浏览器方案来提取相关图像的分类器。

关键词

引用

@article{arxiv.2001.04338,
  title  = {Extraction of Relevant Images for Boilerplate Removal in Web Browsers},
  author = {Joy Bose},
  journal= {arXiv preprint arXiv:2001.04338},
  year   = {2020}
}

备注

4 pages, 3 figures, 1 table