中文

高维二次判别分析:最优性与相变

统计理论 2023-02-23 v2 统计理论

摘要

考虑一个两类分类问题,其中我们观测样本 (Xi,Yi)(X_i, Y_i),i = 1, ..., n,XiRpX_i \in R^pYi{0,1}Y_i \in \{0, 1\}。给定 Yi=kY_i = kXiX_i 假设服从均值为 μkRk\mu_k \in R^k、协方差矩阵为 Σk\Sigma_k(k=0,1)的多元正态分布。假设观测到来自同一混合体的新样本 X,我们的目标是估计其类别标签 Y。当 Sigma_0 = Sigma_1 时,此类高维分类问题已被充分研究。然而,多年来关于 Σ0Σ1\Sigma_0 \neq \Sigma_1 情形的讨论要少得多。本文提出针对弱信号的二次判别分析(QDAw)算法,以及带特征选择的 QDA(QDAfs)算法。QDAfs 应用偏相关筛选估计 Ω^0\hat{\Omega}_0Ω^1\hat{\Omega}_1,然后对 Ω^0Ω^1\hat{\Omega}_0 - \hat\Omega_1 的对角元进行硬阈值处理。QDAfs 进一步包含线性项 dTXd^T X,其中 d 通过对 Ω^1μ^1Ω^0μ^0\hat{\Omega}_1\hat{\mu}_1 - \hat{\Omega}_0\hat{\mu}_0 的硬阈值处理得到。我们进一步提出稀有弱模型来建模 Ω0Ω1\Omega_0 - \Omega_1μ0μ1\mu_0 - \mu_1 中的信号。基于 μ0μ1\mu_0 - \mu_1 中信号的弱性与稀疏性,我们提出两种估计标签的方法:1) 针对弱但稠密信号的 QDAw;2) 针对相对强但稀疏信号的 QDAfs。我们给出了 4 维参数空间上的分类边界:1) 可能性区域,其中 QDAw 或 QDAfs 均将达到 0 误分类错误率;2) 不可能性区域,其中所有分类器都将具有恒定错误率。来自真实数据集的数值结果支持了我们的理论,并证明了分类中使用 QDA 相对于 LDA 的必要性与优越性。

关键词

引用

@article{arxiv.2108.10802,
  title  = {High Dimensional Quadratic Discriminant Analysis: Optimality and Phase Transitions},
  author = {Wanjie Wang and Jingjing Wu and Zhigang Yao},
  journal= {arXiv preprint arXiv:2108.10802},
  year   = {2023}
}