中文

荒野区域数据集:将 Covertype 数据集改造用于无监督学习

机器学习 2019-02-01 v1 机器学习

摘要

基准数据集在机器学习研究中至关重要,这一点可由为使其公开可用而存在的众多存储库数量所表明。尽管其中许多也可用于流挖掘场景,但哪些数据集可用于评估数据流聚类算法则不那么明显。我们注意到经典的 Covertype 数据集因其规模而在流挖掘中具有吸引力,但不幸的是它专为分类而设计。在此我们详述将 Covertype 数据集转化为适用于无监督学习的数据集的过程,我们称之为荒野区域(Wilderness Area)数据集。我们的定量分析使我们得出结论:相较于原始 Covertype 数据集,荒野区域数据集更适用于无监督学习。

关键词

引用

@article{arxiv.1901.11040,
  title  = {The Wilderness Area Data Set: Adapting the Covertype data set for unsupervised learning},
  author = {Richard Hugh Moulton and Jakub Zgraja},
  journal= {arXiv preprint arXiv:1901.11040},
  year   = {2019}
}

备注

8 pages, 4 figures