中文

用于鲁棒增量数据可视化的自组织星云生长方法

计算机视觉与模式识别 2020-10-05 v3 人机交互 机器学习

摘要

非参数降维技术,如 t-SNE 和 UMAP,擅长为固定大小的数据集提供可视化。然而,它们无法将新数据点增量映射并插入到已有的数据可视化中。我们提出自组织星云生长(Self-Organizing Nebulous Growths, SONG),一种支持增量数据可视化的参数化非线性降维技术,即在新数据增量加入的同时保留已有可视化的结构。此外,SONG 能够处理新的数据增量,无论其与已观测数据分布相似还是异质。我们在多个真实与模拟数据集上测试了 SONG。结果表明,在增量数据可视化方面 SONG 优于参数化 t-SNE、t-SNE 和 UMAP。具体而言,对于异质增量,在 Fashion MNIST 数据集上 SONG 以调整互信息分数衡量的簇质量相较参数化 t-SNE 提升 14.98%,在 MNIST 数据集上提升 49.73%。对于相似或同质增量,提升分别为 8.36% 和 42.26%。此外,即便上述数据集一次性全部给出,SONG 表现也优于或可与 UMAP 媲美,且优于 t-SNE。我们还证明,SONG 的算法基础使其相较 UMAP 和 t-SNE 对噪声更具容忍度,从而对于高方差、簇高度混合或含噪声的数据具有更大效用。

关键词

引用

@article{arxiv.1912.04896,
  title  = {Self Organizing Nebulous Growths for Robust and Incremental Data Visualization},
  author = {Damith Senanayake and Wei Wang and Shalin H. Naik and Saman Halgamuge},
  journal= {arXiv preprint arXiv:1912.04896},
  year   = {2020}
}

备注

in IEEE Transactions on Neural Networks and Learning Systems