具有潜在结构的高维随机向量的近似重复分量检测
统计方法学
2020-10-07 v1 统计理论
统计理论
摘要
高维特征向量很可能包含彼此为近似重复的一组测量值。在复杂应用或自动化数据收集过程中,这些特征集并非先验已知,需要被确定。本文提出一类关于观测高维随机向量 的潜在因子模型,用于定义、识别并估计其近似重复分量的指标集。该模型类由一个 载荷矩阵 参数化,其中包含一个隐藏子矩阵,其行可划分为若干平行向量组。在此模型类下, 的一组近似重复分量对应于 中的一组平行行:这些 的条目在尺度与加性误差意义下,是 个潜在因子的同一线性组合; 的值本身未知。在 中寻找近似重复的问题归结为识别并估计隐藏子矩阵在 中的位置及其行指标集 的划分。 及其划分均可借助基于 相关矩阵的一族新准则完整刻画,其可识别性以及未知潜在维数 的可识别性均作为推论得到。可识别性论证的构造性本质使得计算高效的流程得以实现,并具备一致性保证。当 具有变量误差参数化时,问题难度升高。任务变为从 中其他稠密平行行里分离出与标准基向量成比例的平行行组。在尺度假设下,通过以适当协方差矩阵的 Schur 补连续最大化为指导、有原则地选取目标行指标,该问题得以解决。
引用
@article{arxiv.2010.02288,
title = {Detecting approximate replicate components of a high-dimensional random vector with latent structure},
author = {Xin Bing and Florentina Bunea and Marten Wegkamp},
journal= {arXiv preprint arXiv:2010.02288},
year = {2020}
}