中文

考虑文档过时性的网络搜索引擎机器人最优阈值控制

网络与互联网体系结构 2012-01-20 v1

摘要

典型的网络搜索引擎由三个主要部分组成:爬虫引擎、索引引擎和搜索引擎。本工作旨在优化爬虫引擎的性能。爬虫引擎负责发现新网页并更新网络搜索引擎数据库中的现有网页。爬虫引擎拥有多个从互联网收集信息的机器人。我们首先计算系统的各种性能指标(例如,由于缓冲区溢出导致任意网页丢失的概率、系统饥饿概率、缓冲区中的平均等待时间)。直观上,我们希望避免系统饥饿,同时最小化信息丢失。我们将该问题表述为多准则优化问题,并为每个准则赋予权重。我们在阈值策略类中求解该问题。我们考虑了由批量标记马尔可夫到达过程建模的非常通用的网页到达过程,以及由相位型分布建模的非常通用的服务时间。该模型已应用于 RIAM INRIA-Canon 研究项目框架下由 INRIA Maestro 团队设计的爬虫的性能评估与优化。

关键词

引用

@article{arxiv.1201.4150,
  title  = {Optimal Threshold Control by the Robots of Web Search Engines with Obsolescence of Documents},
  author = {Konstantin Avrachenkov and Alexander Dudin and Valentina Klimenok and Philippe Nain and Olga Semenova},
  journal= {arXiv preprint arXiv:1201.4150},
  year   = {2012}
}