论Perl状态报告器(SRr)在文本挖掘中的利用与重要性
信息检索
2010-01-21 v2
摘要
在生物信息学中,文本挖掘和文本数据挖掘有时可互换使用,是一个从文本中提取高质量信息的过程。Perl状态报告器(SRr)是一个从纯文本文件中提取数据的工具,在本研究论文中,我们阐述了SRr在文本或数据挖掘中的应用。SRr需要一个纯文本输入文件,挖掘过程在该文件上执行。SRr读取输入文件并从中提取高质量信息。典型的文本挖掘任务包括文本分类、文本聚类、概念与实体提取以及文档摘要。SRr可用于这些任务中的任意一项,几乎无需或无需定制工作。在我们的实现中,我们对输入文件执行了文本分类挖掘操作。输入文件有两个感兴趣的参数(firstKey和secondKey)。这两个参数的组合描述了该文件中条目的唯一性,其方式类似于数据库中复合键的作用。SRr逐行读取输入文件,提取感兴趣的参数,并通过将它们连接起来形成一个复合键。随后,它生成一个输出文件,其名称由firstKey和secondKey组成。SRr读取输入文件并跟踪复合键。它进一步将所有具有相同复合键的数据行存储到由SRr基于该复合键生成的输出文件中。
引用
@article{arxiv.1001.3277,
title = {On Utilization and Importance of Perl Status Reporter (SRr) in Text Mining},
author = {Sugam Sharma and Tzusheng Pei and Hari Cohly},
journal= {arXiv preprint arXiv:1001.3277},
year = {2010}
}
备注
7 pages IEEE format, International Journal of Computer Science and Information Security, IJCSIS December 2009, ISSN 1947 5500, http://sites.google.com/site/ijcsis/; Volume 6, No. 3, ISSN 1947 5500