中文

正则化经验风险最小化中一致性与过拟合的新分析方法

统计理论 2016-07-04 v1 机器学习 统计理论

摘要

本工作考虑二元分类问题:给定来自某总体的训练数据 x1,,xnx_1, \dots, x_n 及其关联标签 y1,,yn{0,1}y_1,\dots, y_n \in \left\{0,1 \right\},为不在训练数据中的元素 xx 确定最佳标签。更具体地,本工作考虑正则化经验风险泛函的一种变体,该变体内在地定义于观测数据之上,且不依赖于潜在总体。我们使用现代分析的工具,给出了当正则化参数以与样本大小相关的速率趋于零时渐近一致性的简洁证明。这些分析工具为理解过拟合与欠拟合提供了新框架,并严格地将过拟合的概念与紧致性的缺失联系起来。

关键词

引用

@article{arxiv.1607.00274,
  title  = {A new analytical approach to consistency and overfitting in regularized empirical risk minimization},
  author = {Nicolas Garcia Trillos and Ryan Murray},
  journal= {arXiv preprint arXiv:1607.00274},
  year   = {2016}
}