中文

应用于无监督调查的聚类算法比较

计算机与社会 2018-12-14 v2 机器学习 机器学习

摘要

在考虑用数据回答重要问题时,无监督数据提供了广泛的洞察机会和独特挑战。本研究以学生调查数据为例,具体目标是将学生聚类为相似群体,其潜在概念是识别不同的贫困水平。在数据清洗和组织阶段考虑模糊逻辑,有助于创建用于分析比较的逻辑因变量。使用多种数据降维技术,对调查数据进行了降维和清洗。最后,应用并比较了多种聚类技术(k-means、k-modes 和层次聚类)。尽管每种方法各有优势,但目标是确定哪种方法应用于调查数据,特别是试图识别最贫困学生时最为可行。

关键词

引用

@article{arxiv.1811.12210,
  title  = {A comparison of cluster algorithms as applied to unsupervised surveys},
  author = {Kathleen Campbell Garwood and Ph. D. and Arpit Arun Dhobale},
  journal= {arXiv preprint arXiv:1811.12210},
  year   = {2018}
}