中文

具有潜在结构的高维随机向量的近似重复分量检测

统计方法学 2020-10-07 v1 统计理论 统计理论

摘要

高维特征向量很可能包含彼此为近似重复的一组测量值。在复杂应用或自动化数据收集过程中,这些特征集并非先验已知,需要被确定。本文提出一类关于观测高维随机向量 XRpX \in \mathbb{R}^p 的潜在因子模型,用于定义、识别并估计其近似重复分量的指标集。该模型类由一个 p×Kp \times K 载荷矩阵 AA 参数化,其中包含一个隐藏子矩阵,其行可划分为若干平行向量组。在此模型类下,XX 的一组近似重复分量对应于 AA 中的一组平行行:这些 XX 的条目在尺度与加性误差意义下,是 KK 个潜在因子的同一线性组合;KK 的值本身未知。在 XX 中寻找近似重复的问题归结为识别并估计隐藏子矩阵在 AA 中的位置及其行指标集 HH 的划分。H{H} 及其划分均可借助基于 XX 相关矩阵的一族新准则完整刻画,其可识别性以及未知潜在维数 KK 的可识别性均作为推论得到。可识别性论证的构造性本质使得计算高效的流程得以实现,并具备一致性保证。当 AA 具有变量误差参数化时,问题难度升高。任务变为从 AA 中其他稠密平行行里分离出与标准基向量成比例的平行行组。在尺度假设下,通过以适当协方差矩阵的 Schur 补连续最大化为指导、有原则地选取目标行指标,该问题得以解决。

关键词

引用

@article{arxiv.2010.02288,
  title  = {Detecting approximate replicate components of a high-dimensional random vector with latent structure},
  author = {Xin Bing and Florentina Bunea and Marten Wegkamp},
  journal= {arXiv preprint arXiv:2010.02288},
  year   = {2020}
}