中文

基于T-Graph原理的聚焦爬虫组合链接与内容模型

信息检索 2015-10-02 v1 数字图书馆

摘要

聚焦网络爬虫的两个重要任务是发现Web上相关的主题特定文档,并对其进行分析优先级排序以便后续有效可靠的下载。对于第一个任务,我们提出了一种复杂的自定义算法,用于获取和分析页面最有效的HTML结构元素以及每个未访问链接的主题边界和锚文本,基于此可以高精度地预测和引出未访问页面的主题焦点。因此,我们的新颖方法独特地结合了基于链接和基于内容的方法。对于第二个任务,我们通过使用T-Graph(宝藏图)提出了相关URL的评分函数,以帮助对稍后将放入获取队列的未访问链接进行优先级排序。我们的Web搜索系统称为Treasure-Crawler。本研究论文体现了满足聚焦网络爬虫原则要求的Treasure-Crawler系统的架构设计,并通过插图和测试结果断言了包括所有模块在内的系统结构的正确性。

关键词

引用

@article{arxiv.1305.7265,
  title  = {A Focused Crawler Combinatory Link and Content Model Based on T-Graph Principles},
  author = {Ali Seyfi},
  journal= {arXiv preprint arXiv:1305.7265},
  year   = {2015}
}

备注

14 pages, 6 figures