恢复隐藏社区的信息极限
机器学习
2016-01-26 v2 信息论
math.IT
摘要
我们研究从一个n×n对称数据矩阵A中恢复一个基数为K的隐藏社区的问题,其中对于不同的索引i,j,如果i,j都属于该社区,则A_{ij} ~ P,否则A_{ij} ~ Q,P和Q是两个依赖于n的已知概率分布。如果P=Bern(p)且Q=Bern(q)且p>q,则该问题归结为在一个大的Erdős-Rényi图中找到一个密集连接的K-子图;如果P=N(μ,1)且Q=N(0,1)且μ>0,则对应于在一个大的高斯随机矩阵中定位一个均值升高的K×K主子矩阵。我们关注当n→∞时两种类型的渐近恢复保证:(1) 弱恢复:分类错误的期望数量为o(K);(2) 精确恢复:正确分类所有索引的概率收敛到1。在P和Q的温和假设下,并允许社区规模随n次线性缩放,我们推导出一组恢复的充分条件和一组必要条件,这些条件在渐近意义下是紧的,并具有精确的常数。该结果特别适用于高斯情形,以及有界对数似然比的情形,包括只要p/q和(1-p)/(1-q)远离零和无穷大时的伯努利情形。一个重要的算法启示是,只要精确恢复在信息论上是可能的,任何在社区规模集中于K附近时能提供弱恢复的算法,都可以通过一个简单的投票程序在线性额外时间内升级以实现精确恢复。
引用
@article{arxiv.1509.07859,
title = {Information Limits for Recovering a Hidden Community},
author = {Bruce Hajek and Yihong Wu and Jiaming Xu},
journal= {arXiv preprint arXiv:1509.07859},
year = {2016}
}
备注
v2 establishes information limits of both weak and exact recovery with sharp constants for general P and Q