中文

估计网页变化率的在线算法

信息检索 2021-11-08 v2 机器学习 社会与信息网络 概率论 机器学习

摘要

搜索引擎维护不同网页的本地副本以提供快速搜索结果。该本地缓存由网络爬虫通过频繁访问这些不同页面来跟踪其变化而保持最新。理想情况下,一旦页面在网页上发生变化,本地副本就应更新。然而,有限的带宽可用性和服务器限制约束了不同页面被爬取的频率。这引出了如下优化问题:在爬取频率处于规定界限内的前提下,最大化本地缓存的新鲜度。尽管存在可处理的算法来解决此问题,但这些算法要么假设已知精确的页面变化率,要么使用诸如 MLE 等低效方法来估计变化率。我们在此解决该问题。我们提供了三种用于在线估计页面变化率的新方案,它们每次迭代的运行时间都极低。第一种基于大数定律,第二种基于随机逼近。第三种是第二种的扩展,包含了重球动量项。所有这些方案仅需要关于页面变化过程的部分信息,即仅需知道自上次爬取实例以来页面是否发生变化。我们的主要理论结果涉及这三种方案的渐近收敛性和收敛速率。事实上,我们的工作是首个在梯度与噪声方差均非一致有界时证明原始随机重球方法收敛性的工作。我们还提供了一些(基于真实和合成数据的)数值实验,以证明我们所提出的估计器相对于 MLE 等现有估计器的优越性。我们强调,我们的算法也易于应用于数据库同步和网络库存管理。

关键词

引用

@article{arxiv.2009.08142,
  title  = {Online Algorithms for Estimating Change Rates of Web Pages},
  author = {Konstantin Avrachenkov and Kishor Patil and Gugan Thoppe},
  journal= {arXiv preprint arXiv:2009.08142},
  year   = {2021}
}

备注

This is the author version of the paper accepted to {\it International Journal of Performance Evaluation}, Elsevier; 25 pages. arXiv admin note: text overlap with arXiv:2004.02167