中文

类别数据的降维方法

机器学习 2021-12-08 v1

摘要

类别属性是指可取离散值集合的属性,例如颜色。本工作致力于将类别属性上的向量压缩为低维离散向量。当前基于哈希的方法将类别属性上的向量压缩为低维离散向量,但未能对压缩表示之间的汉明距离提供任何保证。在此我们提出 FSketch 来为稀疏类别数据创建草图,并给出一种仅从草图估计未压缩数据间两两汉明距离的估计器。我们主张这些草图可在通常的数据挖掘任务中替代原始数据而不损害任务质量。为此,我们确保草图同样是类别的、稀疏的,且汉明距离估计足够精确。草图构建与汉明距离估计算法均只需单次扫描;此外,数据点的变更可高效地并入其草图。可压缩性取决于数据的稀疏程度且与原维度无关——这使我们的算法在许多现实场景中具有吸引力。我们的主张由对 FSketch 性质的严格理论分析支撑,并辅以在一些真实数据集上与相关算法的广泛对比评估。我们表明 FSketch 显著更快,且使用其草图在标准无监督任务(RMSE、聚类和相似度搜索)中获得的精度位居前列。

关键词

引用

@article{arxiv.2112.00362,
  title  = {Dimensionality Reduction for Categorical Data},
  author = {Debajyoti Bera and Rameshwar Pratap and Bhisham Dev Verma},
  journal= {arXiv preprint arXiv:2112.00362},
  year   = {2021}
}

备注

Accepted in IEEE Transactions on Knowledge and Data Engineering. Copyright IEEE, 1969