中文

MNIST-Nd:用于跨维度聚类基准的自然istic 数据集集合

机器学习 2024-10-22 v1 机器学习

摘要

受录音技术进步的驱动,大规模高维数据集在多个科学领域中涌现。尤其在生物学领域,聚类常用于从数据集中获取见解,例如理解不同细胞类型的组织结构。然而,聚类已知在高维数据上扩展性差,尽管当前基准数据集主要为二维,导致对维度影响的确切影响尚不清晰。我们提出MNIST-Nd,这是一组合成数据集,分享着真实数据集的关键属性,即单个样本呈噪声且簇不完全分离。MNIST-Nd 通过在 MNIST 上训练混合变分自编码器(2 到 64 个潜在维度),得到包含六个数据集的集合,具有可比的结构但不同维度。这为解耦维度对聚类的影响提供了可能。对MNIST-Nd 上 preliminary 常见聚类算法基准测试表明,Leiden 对维度增长最为稳健。

关键词

引用

@article{arxiv.2410.16124,
  title  = {MNIST-Nd: a set of naturalistic datasets to benchmark clustering across dimensions},
  author = {Polina Turishcheva and Laura Hansel and Martin Ritzert and Marissa A. Weis and Alexander S. Ecker},
  journal= {arXiv preprint arXiv:2410.16124},
  year   = {2024}
}