中文

链接预测的一个隐藏挑战:应检查哪些节点对?

社会与信息网络 2021-02-17 v1 机器学习

摘要

网络中链接预测的传统设定假设存在一个通常是平衡的测试节点对集合,在其上预测链接的存在。然而在实践中并没有测试集:真实情况未知,因此可供预测的候选对数量在图的节点数上呈二次规模。此外,由于图是稀疏的,这些候选对中大多数并非链接。因此,常依赖于保邻近性嵌入或节点相似性的启发式概念的链接预测方法面临巨大的搜索空间,其中许多节点对邻近却不应相连。为缓解该问题,我们引入 LinkWaldo,一个从这一二次规模、极度偏斜的节点对搜索空间中选择简洁候选对集合的框架,这些候选对除邻近外,在结构上还与观测边相似。这使其能忽略某些高邻近但低相似度的对,并识别高相似度、较低邻近度的对。我们的框架建立在一个理论上将随机块模型(SBMs)与节点邻近模型相结合的模型之上。SBM 的块结构勾勒出搜索空间中新链接预期落点,而邻近性利用局部敏感哈希避免昂贵的穷举搜索来识别这些块内最合理的链接。LinkWaldo 可使用任意节点表示学习或启发式邻近定义,并能为任意链接预测方法生成候选对,使当前及未来方法的表示能力得以在实际链接预测中实现。我们在跨多个领域的 13 个网络上评估 LinkWaldo,表明平均而言其返回的候选集比基于嵌入和启发式基线的集合多包含 7–33% 的缺失与未来链接。

关键词

引用

@article{arxiv.2102.07878,
  title  = {A Hidden Challenge of Link Prediction: Which Pairs to Check?},
  author = {Caleb Belth and Alican Büyükçakır and Danai Koutra},
  journal= {arXiv preprint arXiv:2102.07878},
  year   = {2021}
}