误指定密度估计与逻辑回归中具有最优超额风险的非常规估计器
统计理论
2021-12-10 v3 机器学习
机器学习
统计理论
摘要
我们引入一种在对数损失下的条件密度估计过程,称之为 SMP(样本极小极大预测器,Sample Minmax Predictor)。该估计器最小化了一个统计学习的新的一般超额风险界。在标准例子中,该界随 缩放,其中 为模型维数, 为样本量,且关键地在模型误指定下仍然有效。作为一个非常规(模型外)过程,SMP 优于模型内估计器如最大似然估计器,后者的超额风险在误指定下会退化。与归约到序贯问题的方法相比,我们的界去掉了次优的 因子,并能处理无界类。对于高斯线性模型,SMP 的预测与风险界由协变量的杠杆分数支配,在无需噪声方差或线性模型近似误差条件的情况下,几乎匹配良指定情形中的最优风险。对于逻辑回归,SMP 提供了一种依赖虚拟样本的概率预测校准的非贝叶斯方法,并可通过求解两个逻辑回归来计算。它实现了 的非渐近超额风险,其中 界定特征范数, 界定比较参数范数;相比之下,一般而言任何模型内估计器都无法取得优于 的速率。这提供了比贝叶斯方法更实用的替代方案,后者需要近似后验采样,从而部分地回答了 Foster 等人(2018)提出的一个问题。
引用
@article{arxiv.1912.10784,
title = {An improper estimator with optimal excess risk in misspecified density estimation and logistic regression},
author = {Jaouad Mourtada and Stéphane Gaïffas},
journal= {arXiv preprint arXiv:1912.10784},
year = {2021}
}
备注
43 pages, minor revision