DGL-KE:大规模知识图谱嵌入训练
分布式、并行与集群计算
2020-04-21 v1
摘要
知识图谱已成为组织各领域信息的关键抽象,其嵌入表示被越来越多地用于各种信息检索和机器学习任务中以利用其信息。然而,知识图谱规模的不断增长需要计算高效的算法,能够扩展到具有数百万节点和数十亿边的图谱。本文提出 DGL-KE,一个高效计算知识图谱嵌入的开源软件包。DGL-KE 引入了多种新颖优化,利用多进程、多 GPU 和分布式并行,加速在具有数百万节点和数十亿边的知识图谱上的训练。这些优化旨在提高数据局部性、减少通信开销、将计算与内存访问重叠,并实现高运算效率。在包含超过 8600 万节点和 3.38 亿边的知识图谱上的实验表明,DGL-KE 可在配备 8 个 GPU 的 EC2 实例上于 100 分钟内计算嵌入,在配备 4 台机器(每台 48 核)的 EC2 集群上于 30 分钟内完成。这些结果相较于最佳竞争方法实现了 2 至 5 倍的加速。DGL-KE 可在 https://github.com/awslabs/dgl-ke 获取。
引用
@article{arxiv.2004.08532,
title = {DGL-KE: Training Knowledge Graph Embeddings at Scale},
author = {Da Zheng and Xiang Song and Chao Ma and Zeyuan Tan and Zihao Ye and Jin Dong and Hao Xiong and Zheng Zhang and George Karypis},
journal= {arXiv preprint arXiv:2004.08532},
year = {2020}
}