中文

面向稀疏数据半监督学习的因子化图表示

机器学习 2020-03-06 v1 数据库 社会与信息网络 机器学习

摘要

节点分类是图数据管理中的一个重要问题。它通常由各种标签传播方法解决,这些方法从少量带标签的种子节点开始迭代进行。对于类别间具有任意兼容性的图,这些方法关键依赖于已知兼容性矩阵,该矩阵必须由领域专家或启发式方法提供。我们能否改为以原则性且可扩展的方式从稀疏标注的图中直接估计正确的兼容性?我们肯定地回答了这一问题,并提出了一种称为远距离兼容性估计的方法,该方法即使在极度稀疏标注的图上(例如每 10,000 个节点中有 1 个被标注)也能在后续标注剩余节点所需时间的一小部分内完成估计。我们的方法首先创建多个因子化图表示(其大小与图无关),然后在这些较小的图草图上执行估计。我们将代数放大定义为利用算法更新方程的代数性质来放大稀疏信号这一更一般的思路。我们表明,我们的估计器比另一种方法快几个数量级,且端到端分类精度与使用黄金标准兼容性的结果相当。这使其成为任何现有标签传播方法的廉价预处理步骤,并消除了当前对启发式方法的依赖。

关键词

引用

@article{arxiv.2003.02829,
  title  = {Factorized Graph Representations for Semi-Supervised Learning from Sparse Data},
  author = {Krishna Kumar P. and Paul Langton and Wolfgang Gatterbauer},
  journal= {arXiv preprint arXiv:2003.02829},
  year   = {2020}
}

备注

SIGMOD 2020 (Extended version)