荒野区域数据集:将 Covertype 数据集改造用于无监督学习
机器学习
2019-02-01 v1 机器学习
摘要
基准数据集在机器学习研究中至关重要,这一点可由为使其公开可用而存在的众多存储库数量所表明。尽管其中许多也可用于流挖掘场景,但哪些数据集可用于评估数据流聚类算法则不那么明显。我们注意到经典的 Covertype 数据集因其规模而在流挖掘中具有吸引力,但不幸的是它专为分类而设计。在此我们详述将 Covertype 数据集转化为适用于无监督学习的数据集的过程,我们称之为荒野区域(Wilderness Area)数据集。我们的定量分析使我们得出结论:相较于原始 Covertype 数据集,荒野区域数据集更适用于无监督学习。
引用
@article{arxiv.1901.11040,
title = {The Wilderness Area Data Set: Adapting the Covertype data set for unsupervised learning},
author = {Richard Hugh Moulton and Jakub Zgraja},
journal= {arXiv preprint arXiv:1901.11040},
year = {2019}
}
备注
8 pages, 4 figures