中文

学习泊松二项分布的幂

数据结构与算法 2017-07-19 v1 机器学习 统计理论 统计理论

摘要

我们引入同时学习泊松二项分布 (PBD) 所有幂的问题。阶为 nn 的 PBD 是 nn 个相互独立伯努利随机变量 XiX_i 之和的分布,其中 E[Xi]=pi\mathbb{E}[X_i] = p_i。对于范围 [m][m] 中的 kk,该分布的第 kk 次幂是 Pk=i=1nXi(k)P_k = \sum_{i=1}^n X_i^{(k)} 的分布,其中每个伯努利随机变量 Xi(k)X_i^{(k)} 满足 E[Xi(k)]=(pi)k\mathbb{E}[X_i^{(k)}] = (p_i)^k。学习算法可以多次查询任意幂 PkP_k,如果至少以概率 1δ1- \delta 成功学习范围内的所有幂:给定任意 k[m]k \in [m],它返回一个概率分布 QkQ_k,其与 PkP_k 的全变距离至多为 ϵ\epsilon。我们给出了该问题查询复杂度的近乎匹配的下界和上界。我们首先展示了对具有许多分离的不同参数 pip_i 的 PBD 幂实例的查询复杂度下界,并通过考察同时学习类似于我们下界中 PBD 的一类特殊 PBD 所有幂的查询复杂度,几乎匹配了该下界。我们研究了二项分布的基本设定,并提供了使用 O(1/ϵ2)O(1/\epsilon^2) 个样本的最优算法。Diakonikolas、Kane 和 Stewart [COLT'16] 展示了学习 pip_i 在误差 ϵ\epsilon 内需要 Ω(21/ϵ)\Omega(2^{1/\epsilon}) 个样本的下界。从 PBD 的幂中采样是否能降低此采样复杂度的问题,答案是否定的,因为我们展示了指数级数量的样本是不可避免的。在获得 PBD 幂的采样权限后,我们随后给出一个近乎最优的算法来学习其 pip_i。为了证明我们最后两个下界,我们将统计学中经典的极小极大风险定义扩展到估计分布序列的函数。

关键词

引用

@article{arxiv.1707.05662,
  title  = {Learning Powers of Poisson Binomial Distributions},
  author = {Dimitris Fotakis and Vasilis Kontonis and Piotr Krysta and Paul Spirakis},
  journal= {arXiv preprint arXiv:1707.05662},
  year   = {2017}
}