中文

在单次遍历中与经验风险最小化器竞争

机器学习 2015-02-26 v2 机器学习

摘要

在许多估计问题中,例如线性回归和逻辑回归,我们希望仅给定目标函数的无偏样本来最小化一个未知目标。此外,我们力求使用尽可能少的样本来实现这一目标。在没有计算约束的情况下,观测数据样本平均的最小化器——通常被称为经验风险最小化器(ERM)或MM-估计量——因其理想的统计收敛性质而被广泛视为首选的估计策略。本工作的目标是在每一个问题上都表现得与ERM一样好,同时最小化计算资源的使用,如运行时间和空间占用。我们提供了一个简单的流式算法,该算法在底层问题的标准正则性假设下,具有以下性质:* 该算法可在对观测数据进行单次遍历的线性时间内实现,使用的空间与单个样本的大小成线性关系。* 该算法在每一个问题上都能达到与经验风险最小化器相同的统计收敛速率,甚至考虑常数因子。* 该算法的性能对初始误差的依赖速率呈超多项式下降。* 该算法易于并行化。此外,我们量化了该算法变得与ERM具有竞争力的(有限样本)速率。

关键词

引用

@article{arxiv.1412.6606,
  title  = {Competing with the Empirical Risk Minimizer in a Single Pass},
  author = {Roy Frostig and Rong Ge and Sham M. Kakade and Aaron Sidford},
  journal= {arXiv preprint arXiv:1412.6606},
  year   = {2015}
}