中文

超越 Catoni:重尾与鲁棒均值估计的更优速率

统计理论 2024-02-20 v3 数据结构与算法 信息论 math.IT 统计理论

摘要

我们研究在给定 nn 个样本的情况下估计协方差满足 Σσ2Id\Sigma \preccurlyeq \sigma^2 I_ddd 维分布均值这一基本问题。当 d=1d = 1 时,\cite{catoni} 给出了误差为 (1+o(1))σ2log1δn(1+o(1)) \cdot \sigma \sqrt{\frac{2 \log \frac{1}{\delta}}{n}}、以概率 1δ1 - \delta 成立的估计量,与高斯误差速率相匹配。对于 d>1d>1,一种自然的估计量输出一维置信区间的最小包围球的中心,以达成 1δ1-\delta 置信半径 2dd+1σ(dn+2log1δn)\sqrt{\frac{2 d}{d+1}} \cdot \sigma \left(\sqrt{\frac{d}{n}} + \sqrt{\frac{2 \log \frac{1}{\delta}}{n}}\right),相较高斯速率损失了 2dd+1\sqrt{\frac{2d}{d+1}} 因子。当 dn\sqrt{\frac{d}{n}} 项以 log1δ\sqrt{\log \frac{1}{\delta}} 因子占优时,\cite{lee2022optimal-highdim} 给出了匹配高斯速率的改进估计量。这引出一个自然的问题:当 2log1δn\sqrt{\frac{2 \log \frac{1}{\delta}}{n}} 项占优时,2dd+1\sqrt{\frac{2 d}{d+1}} 的损失是否必要?我们证明答案是否定的——我们构造了一个相比上述朴素估计量在常数因子上更优的估计量。我们还考虑鲁棒估计,其中允许对手任意破坏 ϵ\epsilon 比例的样本:在这种情况下,我们证明上述结合一维估计并承受 2dd+1\sqrt{\frac{2d}{d+1}} 因子的策略在无限样本极限下是最优的。

关键词

引用

@article{arxiv.2311.13010,
  title  = {Beyond Catoni: Sharper Rates for Heavy-Tailed and Robust Mean Estimation},
  author = {Shivam Gupta and Samuel B. Hopkins and Eric Price},
  journal= {arXiv preprint arXiv:2311.13010},
  year   = {2024}
}