一种聚焦式网络采集的简单机制
信息检索
2008-09-05 v1 计算机与社会
摘要
聚焦式网络采集被部署用于实现自动化和全面的索引数据库,作为虚拟主题数据集成的一种替代方式。网络采集不仅通过指定目标URL,还通过预定义人工编辑的采集参数来提高速度和准确性,从而得以实现和扩展。采集参数集包含三个主要组成部分。首先,从目标URL的第一页开始计算,包含所需信息的最终页面被采集的深度尺度。其次,焦点编号用于确定包含相关信息的精确框。最后,关键词组合用于识别这些最终页面中嵌入的相关图像或全文的遇到超链接。所有参数均可通过集成的网络界面由参与机构的管理员访问,并针对每个目标进行完全自定义。还简要介绍了在涵盖印度尼西亚所有科学信息的印度尼西亚科学索引中的一个实际实现。
引用
@article{arxiv.0809.0723,
title = {A Simple Mechanism for Focused Web-harvesting},
author = {Z. Akbar and L. T. Handoko},
journal= {arXiv preprint arXiv:0809.0723},
year = {2008}
}
备注
6 pages, 4 figures, Proceeding of the International Conference on Advanced Computational Intelligence and Its Applications 2008