从人口与健康调查数据学习贝叶斯网络
人工智能
2020-04-30 v2 机器学习
摘要
在中低收入国家,由肺炎与腹泻等可预防疾病导致的儿童死亡仍是一项严峻的全球挑战。我们结合知识以及来自印度的可用人口与健康调查(DHS)数据,构建因果贝叶斯网络(CBNs)并探究与儿童腹泻相关的因素。我们利用免费工具,通过基于评分、基于约束以及混合的结构学习算法来学习 DHS 数据的图结构。我们考察了缺失值、样本量以及基于知识的约束对各结构学习算法的影响,并使用多种评分函数评估其准确性。调查方法与可用数据的不足,以及不同算法生成的 CBN 间的变异性,意味着无法从数据中学习出确定的 CBN。然而,发现基于知识的约束有助于减少不同算法所生成图形的变异,并产出更能反映数据中可能的影响关系的图形。此外,获得了关于结构学习算法性能与特征的宝贵见解。特别是两种基于评分的算法 TABU 与 FGES 展现出许多可取特质:a) 在充足数据下,它们生成与参考图相似的图;b) 它们对缺失值相对不敏感;c) 在基于知识的约束下表现良好。结果为进一步探究 DHS 数据以及更深入理解结构学习算法在真实世界环境中的行为提供了基础。
引用
@article{arxiv.1912.00715,
title = {Learning Bayesian networks from demographic and health survey data},
author = {Neville Kenneth Kitson and Anthony C. Constantinou},
journal= {arXiv preprint arXiv:1912.00715},
year = {2020}
}