中文

从混合数据中解码:精确的信息论界

概率论 2019-02-18 v1 信息论 math.IT

摘要

考虑一个由 nn 个个体组成的群体,每个个体具有 dd 种类型之一(例如他们的血型,在这种情况下 d=4d=4)。我们可以通过指定群体的一个子集来查询该数据库,作为响应,我们观察到混合个体类型的一个无噪声直方图(一个 dd 维计数向量)。这种测量模型出现在实际情况中,例如基因数据的混合,也可能出于隐私考虑而受到启发。我们感兴趣的是明确确定每个个体类型所需的查询次数。在本文中,我们在随机、稠密设定下研究这一信息论问题,其中在每次查询中,选择大小与 nn 成正比的随机个体子集。这使得该问题成为具有“植入”解的随机约束满足问题(CSP)的一个特例。我们建立了关于最小查询次数 mm 的几乎匹配的上下界,使得当 nn 趋于无穷大时,除植入解外无其他解的概率趋于 1。我们的证明依赖于计算该模型在热力学极限下的精确“退火自由能”,它对应于该植入 CSP 的期望解数衰减的指数速率。作为分析的副产品,我们展示了一个具有独立意义的恒等式,将图上欧拉流空间上的高斯积分与其生成树多项式联系起来。

关键词

引用

@article{arxiv.1611.09981,
  title  = {Decoding from Pooled Data: Sharp Information-Theoretic Bounds},
  author = {Ahmed El Alaoui and Aaditya Ramdas and Florent Krzakala and Lenka Zdeborova and Michael I. Jordan},
  journal= {arXiv preprint arXiv:1611.09981},
  year   = {2019}
}