Marius:在单机上学习大规模图嵌入
机器学习
2021-05-27 v2 数据库
分布式、并行与集群计算
摘要
我们提出了一种在单台机器上计算大规模图嵌入的新框架。图嵌入是图中每个节点(和/或边类型)的固定长度向量表示,已成为在现代机器学习中处理图的事实标准方法。我们指出,当前用于学习大规模图嵌入的系统受限于数据移动,导致资源利用率低下和训练效率不高。这些限制使得最先进的系统必须将训练分布到多台机器上。我们提出 Marius,一个通过利用分区缓存和缓冲感知的数据排序来最小化磁盘访问、并将数据移动与计算交错以最大化利用率的高效图嵌入训练系统。我们在多种基准测试上将 Marius 与两个最先进的工业系统进行比较。我们证明 Marius 达到了相同的精度水平,但速度最高快一个数量级。我们还展示了 Marius 能够将训练扩展到超出单机 GPU 和 CPU 内存容量一个数量级的数据集,从而能够在具有 16 GB GPU 内存和 64 GB CPU 内存的单机上训练具有超过十亿条边和 550 GB 总参数的配置。Marius 已在 www.marius-project.org 开源。
引用
@article{arxiv.2101.08358,
title = {Marius: Learning Massive Graph Embeddings on a Single Machine},
author = {Jason Mohoney and Roger Waleffe and Yiheng Xu and Theodoros Rekatsinas and Shivaram Venkataraman},
journal= {arXiv preprint arXiv:2101.08358},
year = {2021}
}
备注
Accepted into OSDI '21