中文

勿读,只看:利用视觉特征从网页提取主要内容

信息检索 2022-01-26 v2

摘要

从网页提取主要内容可提供去除了导航菜单、广告和站点模板等次要区域的主要信息块。主要内容提取有诸多应用:信息检索、搜索引擎优化和浏览器阅读模式。我们用2017与2020年全球网站的两个英文数据集及2020年按语言划分的七个非英文数据集的网页评估了现有四种主要内容提取方法(Readability.js、Chrome DOM Distiller、Web2Text和Boilernet)。结果显示,非英文数据集的性能比英文数据集低至多40%。因此,本文提出一种利用视觉特征(元素位置、尺寸及距三个中心的距离)的多语言主要内容提取方法。这三个中心分别源自浏览器窗口、Web文档和首个浏览区域。我们提出此首个浏览区域,即Web文档顶部,用于模拟用户首次接触网页的情形。由于网页作者为可用性将主要内容置于中央区域,可假设该区域中心接近主要内容。我们的网格居中扩展(GCE)方法将三个质心作为假设的用户焦点。从最接近这些质心的各叶节点遍历DOM树,我们的方法考察哪个祖先节点可作为主要内容候选。最终,通过从三个主要内容候选中选优来提取主要内容。我们的方法在最长公共子序列F1分数上平均比现有方法高14%。特别地,在英文数据集上性能提升至多25%,在非英文数据集上提升16%。因此,我们的方法表明视觉与基础HTML特征在主要内容提取中是有效的。

关键词

引用

@article{arxiv.2110.14164,
  title  = {Don't read, just look: Main content extraction from web pages using visual features},
  author = {Geunseong Jung and Sungjae Han and Hansung Kim and Kwanguk Kim and Jaehyuk Cha},
  journal= {arXiv preprint arXiv:2110.14164},
  year   = {2022}
}