中文

贝叶斯网络的平方Hellinger次可加性及其在恒等检验中的应用

机器学习 2016-12-12 v1 信息论 math.IT 概率论 统计理论 机器学习 统计理论

摘要

我们证明了同一有向图 GG 上的两个贝叶斯网络之间的平方Hellinger距离相对于 GG 的邻域是次可加的。即,如果 PPQQ 是由同一DAG上两个贝叶斯网络定义的概率分布,我们的不等式表明 PPQQ 之间的平方Hellinger距离 H2(P,Q)H^2(P,Q)PPQQ 在DAG中每个节点 vv 及其父节点 Πv\Pi_v 上的边缘分布的平方Hellinger距离之和 vH2(P{v}Πv,Q{v}Πv)\sum_v H^2(P_{\{v\} \cup \Pi_v}, Q_{\{v\} \cup \Pi_v}) 为上界。重要的是,我们的界不涉及条件分布,而是涉及 PPQQ 的边缘分布。我们针对更一般的马尔可夫随机场推导了类似的不等式。作为我们不等式的应用,我们表明,区分同一(但可能未知)DAG上的两个贝叶斯网络 PPQQ 是满足 P=QP=Q 还是 dTV(P,Q)>ϵd_{\rm TV}(P,Q)>\epsilon 可以通过 O~(Σ3/4(d+1)n/ϵ2)\tilde{O}(|\Sigma|^{3/4(d+1)} \cdot n/\epsilon^2) 个样本完成,其中 dd 是DAG的最大入度,Σ\Sigma 是贝叶斯网络每个变量的定义域。如果 PPQQ 定义在可能不同且可能未知的树上,样本复杂度变为 O~(Σ4.5n/ϵ2)\tilde{O}(|\Sigma|^{4.5} n/\epsilon^2),其对 n,ϵn, \epsilon 的依赖性在对数因子意义上是最优的。最后,如果 PPQQ{0,1}n\{0,1\}^n 上的乘积分布且 QQ 已知,样本复杂度变为 O(n/ϵ2)O(\sqrt{n}/\epsilon^2),这在常数因子意义上是最优的。

关键词

引用

@article{arxiv.1612.03164,
  title  = {Square Hellinger Subadditivity for Bayesian Networks and its Applications to Identity Testing},
  author = {Constantinos Daskalakis and Qinxuan Pan},
  journal= {arXiv preprint arXiv:1612.03164},
  year   = {2016}
}