一种估计高维数据秩的可扩展方法
统计计算
2021-08-02 v1
摘要
对高维数据开展有效分析的一个关键挑战,是寻找富含信号、低维的表示。对于线性子空间,这通常通过对设计矩阵(借助特征值或奇异值分解)分解为正交分量,并保留具有充分变异的那些分量来完成。这等价于估计矩阵的秩,而决定保留哪些分量一般采用启发式或临时方法,例如绘制递减的特征值序列并寻找图中的“拐点”。尽管这些方法已被证明有效,但标定不当或误判的拐点位置会导致低维表示中噪声过多或信号不足,使后续建模困难。本文中,我们提出一种潜空间构建过程,通过保留其变异显著大于随机矩阵的分量来估计矩阵可检测信号空间的秩,其中随机矩阵的特征值服从普适的 March\u{e}nko-Pastur(MP)分布。
引用
@article{arxiv.2107.14426,
title = {A Scalable Approach to Estimating the Rank of High-Dimensional Data},
author = {Wenlan Zang and Jen-hwa Chu and Michael J. Kane},
journal= {arXiv preprint arXiv:2107.14426},
year = {2021}
}
备注
35 pages, 3 figures, JSM conference 2020