中文

面向百亿亿次数据的具有自动模型选择功能的分布式非负RESCAL

分布式、并行与集群计算 2022-02-22 v1

摘要

随着计算机硬件与软件、社交媒体、物联网平台以及通信的发展,全球产生的数据量呈指数级增长。在这些数据中,关系型数据集因其对社区演化及其交互的独特洞察而日益受到青睐。关系型数据集天然具有非负、稀疏和超大规模的特性。关系型数据通常包含三元组(主体,关系,客体),并被表示为图/多重图,称为知识图谱,需要将其嵌入到低维稠密向量空间中。在各种嵌入模型中,RESCAL能够学习关系数据以提取潜变量的后验分布并预测缺失关系。然而,RESCAL计算需求高,需要快速且分布式的实现来分析超大规模的真实世界数据集。本文提出了一种面向异构CPU/GPU架构的分布式非负RESCAL算法,可自动选择潜社区数量(模型选择),称为pyDRESCALk。我们利用真实世界和大型合成张量验证了pyDRESCALk的正确性,并展示了其与理论复杂度相符的近线性扩展效能。最后,pyDRESCALk确定了一个11太字节稠密和9艾字节稀疏合成张量中的潜社区数量。

关键词

引用

@article{arxiv.2202.09512,
  title  = {Distributed non-negative RESCAL with Automatic Model Selection for Exascale Data},
  author = {Manish Bhattarai and Namita Kharat and Erik Skau and Benjamin Nebgen and Hristo Djidjev and Sanjay Rajopadhye and James P. Smith and Boian Alexandrov},
  journal= {arXiv preprint arXiv:2202.09512},
  year   = {2022}
}