中文

大数据领域的分类技术综述

机器学习 2015-03-26 v1

摘要

大数据涉及体积庞大、不断增长、具有复杂性且来源多样的数据集。早期技术无法处理海量数据的存储与加工,因此大数据概念应运而生。对于非结构化数据而言,这是一项繁琐的工作。因此,需要某种机制将非结构化数据分类为有序形式,以帮助用户轻松访问所需数据。针对大型事务数据库的分类技术能够以更简单的方式从大数据集中为用户提供所需数据。主要有两种分类技术:监督学习和无监督学习。本文重点研究不同的监督分类技术,并进一步展示了其优势与局限性。

关键词

引用

@article{arxiv.1503.07477,
  title  = {A Survey of Classification Techniques in the Area of Big Data},
  author = {Praful Koturwar and Sheetal Girase and Debajyoti Mukhopadhyay},
  journal= {arXiv preprint arXiv:1503.07477},
  year   = {2015}
}

备注

7 pages, 3 figures, 2 tables in IJAFRC, Vol.1, Issue 11, November 2014, ISSN: 2348-4853