中文

基于 Apache Spark 的贝叶斯网络学习中可扩展的精确父节点集识别

人工智能 2019-01-09 v2 分布式、并行与集群计算

摘要

在机器学习中,父节点集识别问题旨在给定数据和某种预定义评分函数的情况下,寻找最能解释所选变量的随机变量集合。该问题是贝叶斯网络结构学习和 Markov 毯发现的关键组成部分,因此在从欺诈检测到临床决策支持等众多领域具有实际应用。在本文中,我们引入了一种新的分布式内存方法来解决精确父节点集分配问题。为实现可扩展性,我们推导出了使用 MDL 评分函数时约束搜索空间的理论界限,并重组了底层动态规划,以提高计算密度并消除细粒度同步。随后,我们在 Apache Spark 平台上设计了该方法的高效实现。通过实验结果,我们证明该方法在 500 核的独立 Spark 集群上保持了强可扩展性,并且可用于高效处理包含 70 个变量的数据集,远超现有解决方案的处理能力。

关键词

引用

@article{arxiv.1705.06390,
  title  = {Scalable Exact Parent Sets Identification in Bayesian Networks Learning with Apache Spark},
  author = {Subhadeep Karan and Jaroslaw Zola},
  journal= {arXiv preprint arXiv:1705.06390},
  year   = {2019}
}