中文

通过样本外扩展实现大规模数据的核外降维

机器学习 2024-08-09 v1

摘要

降维(DR)是高维数据集可视化的一种成熟方法。虽然DR方法通常应用于文献中的典型DR基准数据集,但它们可能面临较高的运行时间复杂度和内存需求,使其不适合在高效计算环境之外进行大规模数据可视化。为了对大规模数据集执行降维,我们提出了样本外扩展的使用。此类扩展允许将新数据插入现有投影中,我们利用这一点将数据迭代地投影到仅包含少量可管理子集的参考投影中。这一过程使得对大规模数据进行核外降维成为可能,否则由于内存和运行时间限制将无法实现。对于度量多维缩放(MDS),我们贡献了一个具有样本外投影能力的实现,因为典型的软件库不支持它。我们使用文献中的质量指标对五种常见DR算法(MDS、PCA、t-SNE、UMAP和自编码器)的投影质量进行了评估,并分析了参考集大小与投影质量之间的权衡。还根据参考集大小、样本外批次大小和数据集的维度对算法的运行时间行为进行了量化。此外,我们将样本外方法与其他近期提出的DR方法(如PaCMAP和TriMAP)进行了比较,这些方法声称能够处理比传统方法更大的数据集。为了展示这种大规模降维的实用性,我们贡献了一个用例,其中分析了总计十亿条投影实例的流线集合。

关键词

引用

@article{arxiv.2408.04129,
  title  = {Out-of-Core Dimensionality Reduction for Large Data via Out-of-Sample Extensions},
  author = {Luca Reichmann and David Hägele and Daniel Weiskopf},
  journal= {arXiv preprint arXiv:2408.04129},
  year   = {2024}
}