中文

误指定密度估计与逻辑回归中具有最优超额风险的非常规估计器

统计理论 2021-12-10 v3 机器学习 机器学习 统计理论

摘要

我们引入一种在对数损失下的条件密度估计过程,称之为 SMP(样本极小极大预测器,Sample Minmax Predictor)。该估计器最小化了一个统计学习的新的一般超额风险界。在标准例子中,该界随 d/nd/n 缩放,其中 dd 为模型维数,nn 为样本量,且关键地在模型误指定下仍然有效。作为一个非常规(模型外)过程,SMP 优于模型内估计器如最大似然估计器,后者的超额风险在误指定下会退化。与归约到序贯问题的方法相比,我们的界去掉了次优的 logn\log n 因子,并能处理无界类。对于高斯线性模型,SMP 的预测与风险界由协变量的杠杆分数支配,在无需噪声方差或线性模型近似误差条件的情况下,几乎匹配良指定情形中的最优风险。对于逻辑回归,SMP 提供了一种依赖虚拟样本的概率预测校准的非贝叶斯方法,并可通过求解两个逻辑回归来计算。它实现了 O((d+B2R2)/n)O((d + B^2R^2)/n) 的非渐近超额风险,其中 RR 界定特征范数,BB 界定比较参数范数;相比之下,一般而言任何模型内估计器都无法取得优于 min(BR/n,deBR/n)\min({B R}/{\sqrt{n}}, {d e^{BR}}/{n} ) 的速率。这提供了比贝叶斯方法更实用的替代方案,后者需要近似后验采样,从而部分地回答了 Foster 等人(2018)提出的一个问题。

关键词

引用

@article{arxiv.1912.10784,
  title  = {An improper estimator with optimal excess risk in misspecified density estimation and logistic regression},
  author = {Jaouad Mourtada and Stéphane Gaïffas},
  journal= {arXiv preprint arXiv:1912.10784},
  year   = {2021}
}

备注

43 pages, minor revision