基于 Apache Spark 的贝叶斯网络学习中可扩展的精确父节点集识别
人工智能
2019-01-09 v2 分布式、并行与集群计算
摘要
在机器学习中,父节点集识别问题旨在给定数据和某种预定义评分函数的情况下,寻找最能解释所选变量的随机变量集合。该问题是贝叶斯网络结构学习和 Markov 毯发现的关键组成部分,因此在从欺诈检测到临床决策支持等众多领域具有实际应用。在本文中,我们引入了一种新的分布式内存方法来解决精确父节点集分配问题。为实现可扩展性,我们推导出了使用 MDL 评分函数时约束搜索空间的理论界限,并重组了底层动态规划,以提高计算密度并消除细粒度同步。随后,我们在 Apache Spark 平台上设计了该方法的高效实现。通过实验结果,我们证明该方法在 500 核的独立 Spark 集群上保持了强可扩展性,并且可用于高效处理包含 70 个变量的数据集,远超现有解决方案的处理能力。
引用
@article{arxiv.1705.06390,
title = {Scalable Exact Parent Sets Identification in Bayesian Networks Learning with Apache Spark},
author = {Subhadeep Karan and Jaroslaw Zola},
journal= {arXiv preprint arXiv:1705.06390},
year = {2019}
}