中文

基于主成分分析的可解释网络表示学习

机器学习 2021-06-29 v1 机器学习 统计方法学

摘要

我们考虑针对网络值数据样本的可解释网络表示学习问题。我们提出用于网络的 Principal Component Analysis(PCAN)算法,通过子图计数统计识别网络样本在统计上有意义的低维表示。PCAN 过程提供了一个可解释的框架,可据此轻松可视化、探索并构建网络样本的预测模型。我们进一步引入一种基于快速采样的算法 sPCAN,其在计算上显著比其对应算法更高效,但仍具备可解释性的优势。我们研究了这两种方法之间的关系,并在网络样本为基于核的随机图集合的常见 regime 下分析它们的大样本性质。我们表明在此 regime 下,sPCAN 方法的嵌入满足中心极限定理,且 PCAN 与 sPCAN 的总体水平嵌入等价。我们评估了 PCAN 在自然产生的网络样本中可视化、聚类和分类观测的能力,包括功能连接网络样本和描述美国参议院政治共同投票习惯的动态网络。我们的分析揭示,我们提出的算法提供了描述每个样本中网络的信息性和判别性特征。PCAN 和 sPCAN 方法建立在网络表示学习的现有文献之上,并为网络值数据上可解释学习的新研究方向奠定基础。PCAN 和 sPCAN 方法的公开可用软件可在 https://www.github.com/jihuilee/ 获取。

关键词

引用

@article{arxiv.2106.14238,
  title  = {Interpretable Network Representation Learning with Principal Component Analysis},
  author = {James D. Wilson and Jihui Lee},
  journal= {arXiv preprint arXiv:2106.14238},
  year   = {2021}
}

备注

33 pages. Submitted and currently under review