一种通过在线爬取博客实现持续网络监控的提议架构
信息检索
2012-02-10 v1 社会与信息网络
摘要
及时获取网络空间中注册的信息,可以极大地帮助心理学家、营销人员和政治分析家熟悉、分析、决策并根据社会的不同需求采取正确行动。网络空间中巨大的信息量阻碍了我们持续在线调查整个网络空间。聚焦于特定的博客限制了我们的工作领域,使得在网络空间中进行在线爬取成为可能。本文提出了一种架构,该架构使用聚焦爬虫持续在线爬取相关博客,并对获取的数据进行调查和分析。在线抓取是基于 ping 服务器机器的最新公告完成的。基于针对重要关键短语的目标形成加权图,以便聚焦爬虫能够基于该加权图抓取相关网页的完整文本。
引用
@article{arxiv.1202.1837,
title = {A Proposed Architecture for Continuous Web Monitoring Through Online Crawling of Blogs},
author = {Mehdi Naghavi and Mohsen Sharifi},
journal= {arXiv preprint arXiv:1202.1837},
year = {2012}
}
备注
10 pages, 2 figures