UniNet:基于 Metropolis-Hastings 采样的可扩展网络表示学习
机器学习
2021-01-12 v2 数据库
机器学习
摘要
网络表示学习(NRL)技术已成功应用于各种数据挖掘与机器学习任务中。基于随机游走的 NRL 是一种流行范式,其使用一组随机游走来捕获网络结构信息,然后采用 word2vec 模型学习低维表示。然而,迄今为止仍缺乏一个统一现有基于随机游走的 NRL 模型并支持从大规模网络高效学习的框架。主要障碍来自多样的随机游走模型以及用于随机游走生成的低效采样方法。在本文中,我们首先基于 Metropolis-Hastings 采样技术引入一种新颖且高效的边采样器,并从理论上证明了该边采样器对任意离散概率分布的收敛性质。随后我们提出一种随机游走模型抽象,用户可通过指定动态边权重与随机游走状态轻松定义不同的转移概率。该抽象由我们的边采样器高效支持,因为我们的采样器能以常数时间复杂度从非归一化概率分布中抽样。最后,借助新的边采样器与随机游走模型抽象,我们精心实现了一个名为 UniNet 的可扩展 NRL 框架。我们在 11 个真实数据集上结合 5 种基于随机游走的 NRL 模型进行了全面实验,结果清晰地展示了 UniNet 在十亿边网络上的效率。
引用
@article{arxiv.2010.04895,
title = {UniNet: Scalable Network Representation Learning with Metropolis-Hastings Sampling},
author = {Xingyu Yao and Yingxia Shao and Bin Cui and Lei Chen},
journal= {arXiv preprint arXiv:2010.04895},
year = {2021}
}