中文

一种面向结构的社交媒体站点无监督爬取策略

信息检索 2018-04-10 v1

摘要

现有用于高效爬取社交媒体站点的技术依赖于 URL 模式、查询日志和人工监督。本文描述了 SOUrCe,一种面向结构、利用页面结构来学习如何高效爬取社交媒体站点的无监督爬虫。SOUrCe 包含两个阶段。在其无监督学习阶段,SOUrCe 构建站点地图,基于结构相似性对页面进行聚类,并生成描述站点中不同类型页面如何相互链接的导航表。在其采集阶段,它利用导航表和爬取策略来指导下一步爬取哪些链接的选择。实验表明,该架构能高效支持不同风格的爬取,并且比基线方法更好地聚焦于用户生成内容。

关键词

引用

@article{arxiv.1804.02734,
  title  = {A Structure-Oriented Unsupervised Crawling Strategy for Social Media Sites},
  author = {Keyang Xu and Kyle Yingkai Gao and Jamie Callan},
  journal= {arXiv preprint arXiv:1804.02734},
  year   = {2018}
}