中文

各向异性高斯分布下统计最优的鲁棒均值与协方差估计

统计理论 2023-01-24 v1 数据结构与算法 机器学习 统计理论

摘要

假设 X1,,XNX_{1}, \ldots, X_{N}Rd\mathbb{R}^dNN 个独立高斯向量在 ε\varepsilon-污染模型下的样本,其均值为 μ\mu、协方差为 Σ\Sigma。在强 ε\varepsilon-污染模型中,我们假设对手将原始高斯样本中的 ε\varepsilon 比例向量替换为任意其他向量。我们证明存在均值估计量 μ^\widehat \mu,以至少 1δ1 - \delta 的概率满足如下形式的界:μ^μ2c(Tr(Σ)N+Σlog(1/δ)N+εΣ), \|\widehat{\mu} - \mu\|_2 \le c\left(\sqrt{\frac{\operatorname{Tr}(\Sigma)}{N}} + \sqrt{\frac{\|\Sigma\|\log(1/\delta)}{N}} + \varepsilon\sqrt{\|\Sigma\|}\right), 其中 c>0c > 0 为绝对常数,Σ\|\Sigma\| 表示 Σ\Sigma 的算子范数。在同一污染高斯设定下,我们构造了协方差矩阵 Σ\Sigma 的估计量 Σ^\widehat \Sigma,以至少 1δ1 - \delta 的概率满足 Σ^Σc(ΣTr(Σ)N+Σlog(1/δ)N+εΣ). \left\|\widehat{\Sigma} - \Sigma\right\| \le c\left(\sqrt{\frac{\|\Sigma\|\operatorname{Tr}(\Sigma)}{N}} + \|\Sigma\|\sqrt{\frac{\log(1/\delta)}{N}} + \varepsilon\|\Sigma\|\right). 两个结果在乘法常数因子意义下均为最优。尽管近期鲁棒统计备受关注,在典型高斯情形下同时实现无维度依赖的界仍是未解问题。事实上,若干已有结果要么依赖于维度且要求 Σ\Sigma 接近单位阵,要么对污染水平 ε\varepsilon 的依赖非最优。作为分析的一部分,我们推导了高斯分布、折叠正态分布与卡方分布中心次序统计量的尖锐集中不等式。

关键词

引用

@article{arxiv.2301.09024,
  title  = {Statistically Optimal Robust Mean and Covariance Estimation for Anisotropic Gaussians},
  author = {Arshak Minasyan and Nikita Zhivotovskiy},
  journal= {arXiv preprint arXiv:2301.09024},
  year   = {2023}
}

备注

25 pages