中文

矩阵估计的最近邻方法:作为潜变量模型的盲回归解释

统计理论 2019-11-04 v3 统计理论

摘要

我们考虑非参数盲回归(blind regression)的设置,用于在提供一小部分随机噪声测量值时估计大型 m×nm \times n 矩阵的条目。我们假设矩阵的所有行 u[m]u \in [m] 和列 i[n]i \in [n] 分别关联到潜在特征 xrow(u)x_{\text{row}}(u)xcol(i)x_{\text{col}}(i),并且矩阵的第 (u,i)(u,i) 条目 A(u,i)A(u, i) 等于潜在函数 fff(xrow(u),xcol(i))f(x_{\text{row}}(u), x_{\text{col}}(i))。给定矩阵条目的一个小随机子集的噪声观测,我们的目标是估计矩阵的未观测条目以及“去噪”已观测条目。作为本工作的主要结果,我们引入了一种基于最近邻的估计算法,并在底层潜在函数 ff 为 Lipschitz、底层潜在空间为有界直径波兰空间(Polish space)、且矩阵中观测条目的随机比例至少为 max(m1+δ,n1/2+δ)\max \left( m^{-1 + \delta}, n^{-1/2 + \delta} \right)(对于任意 δ>0\delta > 0)时,建立了其一致性。作为一个重要副产品,我们的分析阐明了广泛用于实践的经典协同过滤算法用于矩阵补全的性能。使用 MovieLens 和 Netflix 数据集的实验表明,我们的算法提供了对基本协同过滤的原则性改进,并且与矩阵分解方法具有竞争力。我们的算法通过张量扁平化为矩阵,自然扩展到张量补全的设置。当应用于图像修复(一种 33 阶张量)的设置时,我们发现我们的方法在基准图像上相对于最先进的张量补全算法具有竞争力。

关键词

引用

@article{arxiv.1705.04867,
  title  = {Nearest Neighbors for Matrix Estimation Interpreted as Blind Regression for Latent Variable Model},
  author = {Yihua Li and Devavrat Shah and Dogyoon Song and Christina Lee Yu},
  journal= {arXiv preprint arXiv:1705.04867},
  year   = {2019}
}

备注

27 pages, 3 figures. To appear in IEEE Transactions on Information Theory