中文

结构化因子模型中的自适应估计及其在重叠聚类中的应用

统计方法学 2019-06-24 v4 统计理论 机器学习 统计理论

摘要

本文提出了一种称为 LOVE 的新估计方法,用于估计稀疏潜因子模型 X = AZ + E 中加载矩阵 A 的条目与结构,其中可观测随机向量 X ∈ R^p,相关不可观测因子 Z ∈ R^K(K 未知),噪声 E 独立。A 的每一行经过缩放且稀疏。为辨识加载矩阵 A,我们要求存在纯变量,即 X 中通过 A 仅与一个潜因子关联的组分。尽管因子数 K、纯变量数目及其位置均未知,我们仅需要对 Z 的协方差矩阵施加温和条件,且每个潜因子至少两个纯变量,即可证明 A 在符号置换下唯一确定。我们关于模型可辨识性的证明是构造性的,并导出从 X 的 n 个观测样本估计因子数目与纯变量集合的新方法。这是我们 LOVE 算法的第一步,该算法无需优化,计算复杂度为 p^2 量级。LOVE 的第二步是一个易于实现的线性规划,用于估计 A。我们证明所得估计量在 p 的对数因子范围内达到极小极大最优速率。该模型结构受数据科学中普遍存在的重叠变量聚类问题驱动。我们将总体水平聚类定义为 X 中通过稀疏矩阵 A 与同一不可观测潜因子关联的组分群,并允许多因子关联。聚类分别以纯变量为锚,形成 p 维随机向量 X 的重叠子群。针对重叠聚类的潜模型方法体现在我们算法名称 LOVE 中。

关键词

引用

@article{arxiv.1704.06977,
  title  = {Adaptive Estimation in Structured Factor Models with Applications to Overlapping Clustering},
  author = {Xin Bing and Florentina Bunea and Yang Ning and Marten Wegkamp},
  journal= {arXiv preprint arXiv:1704.06977},
  year   = {2019}
}