天文与生物数据的聚类分层熵标度搜索
数据结构与算法
2019-11-12 v2 计算工程、金融与科学
摘要
天文学与生物学都正经历数据的爆发式增长,造成了阻碍发现的“大数据”问题,也带来了“大数据”的发现机遇。此类数据常被问及的一个问题是近似搜索(最近邻搜索)。我们提出了一种针对此类数据集的分层搜索算法,其利用了天文与生物数据集中均显现出的特定几何性质,即数据的度量熵与分形维数。我们提出 CHESS(Clustered Hierarchical Entropy-Scaling Search,聚类分层熵标度搜索),一种几乎不损失特异度或灵敏度的搜索工具,在 Sloan Digital Sky Survey 的 APOGEE 数据集上展示了相对于线性搜索 的加速,在 GreenGenes 16S 宏基因组数据集上展示了 的加速,并且相较于 FALCONN 局部敏感哈希库在 APOGEE 上进行了渐近更少的距离比较。CHESS 展示了一种不直接依赖于数据集大小的渐近复杂度,并且通过执行更少的距离比较,在实践中至少比线性搜索快一个数量级。不同于局部敏感哈希方法,CHESS 可使用任意用户定义的距离函数。CHESS 还允许隐式数据压缩,我们在 APOGEE 数据集上进行了演示。我们还讨论了一种支持高效 k-最近邻搜索的扩展。
引用
@article{arxiv.1908.08551,
title = {Clustered Hierarchical Entropy-Scaling Search of Astronomical and Biological Data},
author = {Najib Ishaq and George Student and Noah M. Daniels},
journal= {arXiv preprint arXiv:1908.08551},
year = {2019}
}
备注
Accepted to IEEE Big Data 2019