图表示学习中最大化内聚与分离:一种距离感知负采样方法
机器学习
2021-01-22 v2 社会与信息网络
机器学习
摘要
无监督图表示学习(GRL)的目标是学习反映给定无标签图结构的低维节点嵌入空间。该任务的现有算法依赖于负采样目标,通过维护正负节点对语料库来最大化邻近节点处节点嵌入的相似度(称为“内聚”)。正样本取自短随机游走中共同出现的节点对,而常规方法通过均匀采样随机对来构造负语料库,从而忽略了关于远距离节点对之间结构相异性的有价值信息(称为“分离”)。本文提出一种新颖的距离感知负采样(DNS),通过将负采样概率设置为与成对最短距离成正比,在最大化邻近节点对内聚的同时最大化远距离节点对的分离。我们的方法可与任何GRL算法结合使用,并在多个基准数据集和GRL算法的下游节点分类任务上展示了相对于基线负采样方法的有效性。我们的所有代码和数据集可在 https://github.com/Distance-awareNS/DNS/ 获取。
引用
@article{arxiv.2007.01423,
title = {Maximizing Cohesion and Separation in Graph Representation Learning: A Distance-aware Negative Sampling Approach},
author = {M. Maruf and Anuj Karpatne},
journal= {arXiv preprint arXiv:2007.01423},
year = {2021}
}
备注
14 pages, 9 figures, 3 tables, full length version with appendix; Published in Proceedings of the 2021 SIAM International Conference on Data Mining