中文

回顾与环顾:聚焦网络爬虫中新出链有效预测因子的系统分析

机器学习 2022-11-17 v4

摘要

中小企业依赖详尽的 Web 分析来了解其市场与竞争态势。聚焦爬虫通过抓取并索引 Web 的特定部分来满足这一需求。关键的是,聚焦爬虫必须快速找到尚未被索引的新页面。由于新页面只能经由跟随新出链被发现,预测新出链在实践中非常 relevant。文献中已提出许多用于预测 Web 变化的特征设计。本文以新出链作为持续的预测目标,对这一问题给出结构化分析。具体而言,我们将早期特征设计统一为沿两个维度的分类安排:静态 versus 动态特征,以及页面自身特征 versus 其周边网络特征。在此分类法内,辅以我们新的(主要为动态网络)特征,我们识别出新出链的最佳预测因子。我们的主要结论是:最具信息量的特征是页面自身及其内容相关页面上近期的出新链历史。据此,我们提出一种新的“回顾与环顾”(LBLA)模型,仅使用这些特征。利用所得预测,我们设计了若干评分函数以引导聚焦爬虫前往出新链最多的页面,并比较其性能。LBLA 方法被证明极为有效,优于其他模型,包括那些使用最完备特征集的模型。我们所用的学习器之一为近期的 NGBoost 方法,其假设页面上新出链数量服从泊松分布并学习其参数。这将文献中两条迄今无关的路线联系起来:基于页面特征的预测与基于概率建模的预测。所有实验均在一个由商业聚焦爬虫提供的原始数据集上完成。

关键词

引用

@article{arxiv.2111.05062,
  title  = {Look back, look around: a systematic analysis of effective predictors for new outlinks in focused Web crawling},
  author = {Thi Kim Nhung Dang and Doina Bucur and Berk Atil and Guillaume Pitel and Frank Ruis and Hamidreza Kadkhodaei and Nelly Litvak},
  journal= {arXiv preprint arXiv:2111.05062},
  year   = {2022}
}

备注

23 pages, 15 figures, 4 tables, uses arxiv.sty, added new title, heuristic features and their results added, figures 7, 14, and 15 updated, accepted version