中文

卡方放大:识别隐藏枢纽

机器学习 2016-11-17 v2 数据结构与算法 机器学习

摘要

我们考虑如下通用隐藏枢纽模型:一个n×nn \times n随机矩阵AA,具有kk个特殊行(枢纽)的子集SS:不在SS中的行元素由概率分布p0N(0,σ02)p_0 \sim N(0,\sigma_0^2)生成;对于SS中的每一行,其某些kk个元素由p1N(0,σ12)p_1 \sim N(0,\sigma_1^2)生成(σ1>σ0\sigma_1>\sigma_0),其余元素由p0p_0生成。问题是高效识别高度数枢纽。该模型包含并显著推广了植入高斯子矩阵模型,其中特殊元素全在一个k×kk \times k子矩阵中。存在两个著名壁垒:若kcnlnnk\geq c\sqrt{n\ln n},仅行和就足以在通用模型中找到SS。对于子矩阵问题,通过谱方法或组合方法可改进lnn\sqrt{\ln n}因子至kcnk \ge c\sqrt{n}。在p0=±1p_0=\pm 1(各以概率1/21/2)且p11p_1\equiv 1的变体中,两个壁垒均未被打破。我们给出一种多项式时间算法,当σ12>2σ02\sigma_1^2>2\sigma_0^2时,对某个δ>0\delta >0,在kn0.5δk \ge n^{0.5-\delta}下以高概率识别所有隐藏枢纽。该算法推广到植入元素可能具有不同方差(每个至少与σ12\sigma_1^2一样大)的情形。我们还展示了近乎匹配的下界:对于σ122σ02\sigma_1^2 \le 2\sigma_0^2,不存在多项式时间统计查询算法来区分元素全来自N(0,σ02)N(0,\sigma_0^2)的矩阵与具有k=n0.5δk=n^{0.5-\delta}隐藏枢纽的矩阵(任意δ>0\delta >0)。下界与算法均关联到两个分布的卡方距离是否发散。在临界值σ12=2σ02\sigma_1^2=2\sigma_0^2处,我们证明通用隐藏枢纽问题可在kcn(lnn)1/4k\geq c\sqrt n(\ln n)^{1/4}下求解,改进了朴素的基于行和的方法。

关键词

引用

@article{arxiv.1608.03643,
  title  = {Chi-squared Amplification: Identifying Hidden Hubs},
  author = {Ravi Kannan and Santosh Vempala},
  journal= {arXiv preprint arXiv:1608.03643},
  year   = {2016}
}