中文

基于大数据技术的科学论文分类

分布式、并行与集群计算 2018-02-15 v1 数字图书馆

摘要

无法由传统数据存储与分析系统处理的数据规模被称为大数据。它也指为存储、处理和分析大量数据而开发的各项新技术。针对不同来源产生的大量文档内容自动检索信息、识别研究领域与主题、抽取文档摘要或发现模式,是大数据领域已研究的部分课题。本研究中,在由科学文章组成的数据集上运行的朴素贝叶斯(Naive Bayes)分类算法,尝试自动确定这些文档所属类别。我们开发了一个高效系统,可在云计算基础设施上运行的分布式文档分类算法分析土耳其文科学文档。研究中使用了 Apache Mahout 库。用于分类与聚类分布式文档所需的服务器

关键词

引用

@article{arxiv.1802.05055,
  title  = {Classification of Scientific Papers With Big Data Technologies},
  author = {Selen Gurbuz and Galip Aydin},
  journal= {arXiv preprint arXiv:1802.05055},
  year   = {2018}
}

备注

in Turkish