中文

生成式主成分分析

机器学习 2022-09-08 v2 信息论 机器学习 math.IT 统计理论 统计理论

摘要

本文研究带生成建模假设的主成分分析问题,采用一个涵盖显著特例(包括尖峰矩阵恢复与相位恢复)的通用观测矩阵模型。关键假设是底层信号位于具有有界 kk 维输入的 LL-Lipschitz 连续生成模型的值域附近。我们提出一个二次估计器,并证明其享有 klogLm\sqrt{\frac{k\log L}{m}} 的统计速率,其中 mm 为样本数。我们还提供了近乎匹配的无算法相关下界。此外,我们提供经典幂方法的变体,其在每次迭代中将计算数据投影到生成模型的值域上。我们证明在适当条件下,该方法以指数速度快速收敛到达到上述统计速率的点。我们在尖峰矩阵与相位恢复模型的多个图像数据集上实验,并展示我们的方法相对经典幂方法及为稀疏主成分分析设计的截断幂方法的性能提升。

关键词

引用

@article{arxiv.2203.09693,
  title  = {Generative Principal Component Analysis},
  author = {Zhaoqiang Liu and Jiulong Liu and Subhroshekhar Ghosh and Jun Han and Jonathan Scarlett},
  journal= {arXiv preprint arXiv:2203.09693},
  year   = {2022}
}

备注

ICLR 2022 paper + additional appendix on algorithm-independent lower bounds + corrected experimental results for the Fashion-MNIST dataset