用于改善 UGC 访问的高效博客页面提取器
信息检索
2017-08-29 v1
摘要
博客正成为一种日益流行的信息发布媒体。除主要内容外,当今大多数博客页面还包含广告等噪声信息。去除这些无关元素可以改善用户体验,同时也能使内容更好地适应手机等各种设备。尽管基于模板的提取器准确率很高,但其成本可能非常昂贵,因为需要开发大量模板,且一旦模板更新就会失效。为解决这些问题,我们提出了一种新颖的与模板无关的博客页面内容提取器。首先,我们将博客页面转换为 DOM 树,其中页面中的所有元素(包括标题和正文块)均对应于子树。然后,我们分别为标题和正文块构建子树候选集,并提取子树中所含元素的空间特征和内容特征。利用这些特征训练用于标题和正文块的 SVM 分类器。最后,使用分类器从博客页面中提取主要内容。我们在从九个风格和模板明显不同的博客站点抓取的 2,250 个博客页面上测试了我们的提取器。实验结果验证了我们提取器的有效性。
引用
@article{arxiv.1708.07935,
title = {Effective Blog Pages Extractor for Better UGC Accessing},
author = {Kui Zhao and Yi Wang and Xia Hu and Can Wang},
journal= {arXiv preprint arXiv:1708.07935},
year = {2017}
}
备注
2016 3rd International Conference on Information Science and Control Engineering (ICISCE)