超图社区检测的最小最大误分类率研究
信息论
2018-02-06 v1 math.IT
统计理论
机器学习
统计理论
摘要
本文探讨了超图中的社区检测问题。在一种称为“d-一致超图随机块模型”(d-hSBM)的生成式超图模型下——该模型将随机块模型从图自然推广到 d-一致超图——刻画了渐近最小最大失配率。为证明可达性,我们提出了一种两步多项式时间算法,该算法达到了基本极限。算法的第一步是一种超图谱聚类方法,其达到某一精度水平的局部恢复。第二步是一种局部精炼方法,其利用底层概率模型以及第一步结果中的参数估计。为刻画所提算法的渐近性能,我们首先推导了超图谱聚类步骤达到弱一致性(wweak consistency)的一个充分条件。然后,在第一步弱一致性的保证下,我们将局部精炼步骤中所达到的最坏情况风险上界限定为超图规模的指数衰减函数,并刻画了衰减速率。为证明反向不等式,受可达性部分分析的启发,通过寻找一个包含最具主导性错误事件的更小参数空间,给出了最小最大失配率的下界。结果表明,当节点数趋于无穷时,最小最大失配率以指数速度快速衰减到零,且速率函数是若干散度项的加权组合,其中每一项均为两个伯努利分布之间的 1/2 阶 Renyi 散度。刻画速率函数所涉及的伯努利分布正是 d-hSBM 中超边随机实例化所服从的分布。在合成数据上的实验结果验证了我们的理论发现:精炼步骤对于达到最优统计极限至关重要。
引用
@article{arxiv.1802.00926,
title = {On the Minimax Misclassification Ratio of Hypergraph Community Detection},
author = {I Chien and Chung-Yi Lin and I-Hsiang Wang},
journal= {arXiv preprint arXiv:1802.00926},
year = {2018}
}
备注
Submitted to IEEE Transactions on Information Theory. Parts of this paper was presented at ISIT 2017 and to appear at AISTATS 2018