从网页中提取平面和嵌套数据记录
数据库
2010-02-02 v1
摘要
本文研究了从给定网页中识别和提取平面及嵌套数据记录的问题。随着万维网上信息源的爆炸性增长,识别相关信息片段变得日益困难,因为网页常常被广告、导航面板、版权声明等无关内容所包围,这些内容围绕在网页主要内容周围。因此,挖掘这些数据区域和数据记录以从网页中提取信息来提供增值服务是很有用的。当前可用的自动技术由于性能不佳,在从网页中挖掘数据区域和数据记录方面仍不令人满意。本文提出了一种新颖的方法,用于自动识别和提取网页中的平面和嵌套数据记录。该方法包括两个步骤:(1) 基于视觉线索信息识别和提取数据区域。(2) 从网页的数据区域中自动识别和提取平面和嵌套数据记录。对于步骤1,提出了一种新颖且更有效的方法,该方法利用视觉线索找到由所有类型标签形成的数据区域。对于步骤2,提出了一种更有效和高效的方法,即基于视觉线索的网页数据提取(VCED),该方法从数据区域中提取每条记录,并根据视觉线索信息(每条记录覆盖的面积和包含的数据项数量)识别它是平面还是嵌套数据记录。我们的实验结果表明,所提出的技术是有效的,并且优于现有技术。
引用
@article{arxiv.1002.0139,
title = {Extraction of Flat and Nested Data Records from Web Pages},
author = {P. S Hiremath and Siddu P. Algur},
journal= {arXiv preprint arXiv:1002.0139},
year = {2010}
}
备注
10 Pages IEEE format, International Journal on Computer Science and Engineering, IJCSE 2010, ISSN 0975-3397, Impact Factor 0.583