中文

一种通过在线爬取博客实现持续网络监控的提议架构

信息检索 2012-02-10 v1 社会与信息网络

摘要

及时获取网络空间中注册的信息,可以极大地帮助心理学家、营销人员和政治分析家熟悉、分析、决策并根据社会的不同需求采取正确行动。网络空间中巨大的信息量阻碍了我们持续在线调查整个网络空间。聚焦于特定的博客限制了我们的工作领域,使得在网络空间中进行在线爬取成为可能。本文提出了一种架构,该架构使用聚焦爬虫持续在线爬取相关博客,并对获取的数据进行调查和分析。在线抓取是基于 ping 服务器机器的最新公告完成的。基于针对重要关键短语的目标形成加权图,以便聚焦爬虫能够基于该加权图抓取相关网页的完整文本。

关键词

引用

@article{arxiv.1202.1837,
  title  = {A Proposed Architecture for Continuous Web Monitoring Through Online Crawling of Blogs},
  author = {Mehdi Naghavi and Mohsen Sharifi},
  journal= {arXiv preprint arXiv:1202.1837},
  year   = {2012}
}

备注

10 pages, 2 figures