面向距离相似性度量的 GPU 加速自连接
分布式、并行与集群计算
2018-03-13 v1 数据库
摘要
自连接找出数据集中在由相似性度量定义的阈值内彼此相近的所有对象。因此,自连接是数据库与数据挖掘领域的基本构件,并应用于大数据应用中。本文提出一种使用欧氏距离度量的相似性自连接的 GPU 高效算法。搜索-精炼策略适用于低维数据集,因为索引搜索随维度增加(即维度灾难)而退化。因此,我们针对低维问题,将我们的 GPU 自连接与一种搜索-精炼实现以及一种最先进并行算法进行比较。在低维下,在 GPU 上高效求解自连接问题存在若干独特挑战。低维数据常导致更高的数据密度,引起大量的距离计算与庞大的结果集。随着维度增加,索引搜索变得愈发穷举,形成性能瓶颈。我们利用 GPU 提出了若干技术克服这些挑战。我们提出的技术包括采用有界搜索的 GPU 高效索引、适应大结果集大小的批处理方案,以及通过去除重复搜索来减少距离计算。我们的 GPU 自连接优于搜索-精炼与最先进算法。
引用
@article{arxiv.1803.04120,
title = {GPU Accelerated Self-join for the Distance Similarity Metric},
author = {Michael Gowanlock and Ben Karsin},
journal= {arXiv preprint arXiv:1803.04120},
year = {2018}
}
备注
Accepted for Publication in the 4th IEEE International Workshop on High-Performance Big Data, Deep Learning, and Cloud Computing. To appear in the Proceedings of the 32nd IEEE International Parallel and Distributed Processing Symposium Workshops