中文

随机删失下的经验风险最小化:理论与实证

机器学习 2019-06-06 v1 统计理论 机器学习 统计理论

摘要

我们考虑经典的监督学习问题,即基于观测取值于 Rd\mathbb{R}^dd1d\geq 1)的随机向量 XX,通过最小二乘误差最小的回归规则来预测连续非负随机标签 YY(即随机持续时间)。在从工业质量控制到公共卫生乃至信用风险分析等各类应用中,训练观测可能右删失,即统计学习所依赖的不是 (X,Y)(X,Y) 的独立副本,而是 n1n\geq 1 个独立实现的三元组 (X,  min{Y,  C},  δ)(X, \; \min\{Y,\; C\},\; \delta),其中 CC 为具有未知分布的非负随机变量,建模删失,且 δ=I{YC}\delta=\mathbb{I}\{Y\leq C\} 指示该持续时间是否被右删失。由于在风险计算中忽略删失会明显导致对目标持续时间的严重低估并危及预测,我们提出考虑基于给定 XX 下删失 CC 的条件生存函数的Kaplan-Meier估计量所得到的真实风险的插入式估计(称为Kaplan-Meier风险),以执行经验风险最小化。在温和条件下,我们证明当忽略插入式估计固有的模型偏差问题时,该有偏/加权经验风险泛函最小化子的学习速率为 OP(log(n)/n)O_{\mathbb{P}}(\sqrt{\log(n)/n}),这与无删失情形下可达到的速率一致。除理论结果外,我们还给出了数值实验以说明所发展方法的合理性。

关键词

引用

@article{arxiv.1906.01908,
  title  = {Empirical Risk Minimization under Random Censorship: Theory and Practice},
  author = {Guillaume Ausset and Stéphan Clémençon and François Portier},
  journal= {arXiv preprint arXiv:1906.01908},
  year   = {2019}
}

备注

Submitted to JMLR. 18 pages + Appendix