中文

自举图扩散:揭示非线性的力量

机器学习 2017-03-16 v2

摘要

基于图的半监督学习 (SSL) 算法根据少量种子节点的已知标签预测所有节点的标签。经典方法通过某种底层扩散过程捕捉图结构,该过程沿图边传播。谱扩散(包括个性化 PageRank 和标签传播)通过随机游走传播,而社会扩散则通过最短路径传播。这些扩散的共同基础在于其线性,即无法区分少数“强”关系与众多“弱”关系的贡献。最近,节点嵌入和图卷积网络 (GCN) 等非线性方法在 SSL 任务中展示了巨大的质量提升。这些方法引入了多个组件,且在如何利用图结构、种子标签信息及其他特征方面差异巨大。本文旨在研究非线性作为一个独立因素对性能提升的贡献。为此,我们将经典线性图扩散置于自训练框架中。令人惊讶的是,我们观察到使用由此产生的自举扩散进行 SSL,不仅显著优于各自的非自举基线,甚至超越了最先进的非线性 SSL 方法。此外,由于自训练包装器保留了基线方法的可扩展性,我们同时获得了更高的质量和更好的可扩展性。

关键词

引用

@article{arxiv.1703.02618,
  title  = {Bootstrapped Graph Diffusions: Exposing the Power of Nonlinearity},
  author = {Eliav Buchnik and Edith Cohen},
  journal= {arXiv preprint arXiv:1703.02618},
  year   = {2017}
}

备注

11 pages, 5 figures, 6 tables