Dirichlet 贝叶斯网络评分与最大相对熵原理
统计理论
2018-12-13 v5 统计方法学
机器学习
统计理论
摘要
从数据中学习贝叶斯网络的一种经典方法是识别最大后验 (MAP) 网络结构。在离散贝叶斯网络的情况下,通过最大化几种可能的贝叶斯 Dirichlet (BD) 评分之一来选择 MAP 网络;其中最著名的是 Heckerman 等人 (1995) 提出的贝叶斯 Dirichlet 等效均匀 (BDeu) 评分。BDeu 的关键特性源于其对网络中每个局部分布参数的均匀先验,这使得结构学习在计算上高效;它不需要从专家那里引出先验知识;并且它满足评分等价性。在本文中,我们将回顾 BD 评分特别是 BDeu 的推导和性质,并将它们与相应的熵估计联系起来,从而从信息论的角度进行研究。为此,我们将在 Giffin 和 Caticha (2007) 的基础工作背景下展开,他们证明了贝叶斯推断可以被框架化为最大相对熵原理的一个特例。我们将利用这种联系表明,BDeu 不应被用于稀疏数据的结构学习,因为它违反了最大相对熵原理;而且从更经典的贝叶斯模型选择角度来看,它也是有问题的,因为它产生的贝叶斯因子对其唯一的超参数值敏感。利用大型模拟研究,我们在之前的工作 (Scutari, 2016) 中发现贝叶斯 Dirichlet 稀疏 (BDs) 评分似乎在结构学习中提供了更高的准确性;在本文中,我们进一步表明 BDs 不受上述问题的影响,并建议在稀疏数据中使用它代替 BDeu。最后,我们将表明这些问题实际上是同一问题的不同方面,并且是先验分布假设的后果。
引用
@article{arxiv.1708.00689,
title = {Dirichlet Bayesian Network Scores and the Maximum Relative Entropy Principle},
author = {Marco Scutari},
journal= {arXiv preprint arXiv:1708.00689},
year = {2018}
}
备注
20 pages, 4 figures; extended version submitted to Behaviormetrika