中文

经验风险最小化的通用学习率

机器学习 2025-01-31 v2 机器学习

摘要

众所周知,经验风险最小化(ERM)原则是许多广泛使用机器学习算法的基础,在经典的PAC理论中发挥着 essential 的作用。学习算法性能的常见描述是其所谓的“学习曲线”,即预期误差随输入样本大小的衰减。由于PAC模型无法解释学习曲线的行为,近期研究探索了一种替代的通用学习模型,最终揭示了最优通用学习率与一致学习率之间的差异(Bousquet等,2021)。然而,针对ERM原则深入理解这种差异的基本工作尚未完成。本文我们考虑通过ERM实现的通用学习问题,聚焦可实现概念类的情形并研究可能的通用学习率。我们的主要结果是一条根本性的四分论:通过ERM只有四种可能的通用学习率,即任何可被ERM学习的概念类的学习曲线要么随着en e^{-n}衰减,要么随着1/n1/n衰减,要么随着log(n)/n \log(n)/n衰减,要么以任意缓慢的速率衰减。此外,我们通过新的复杂结构,对哪些概念类落入每个类别提供了完整的特征描述。我们还发展出新的组合维度,这些维度在可能的情况下为这些速率提供尖锐的渐近有效常数因子。

关键词

引用

@article{arxiv.2412.02810,
  title  = {Universal Rates of Empirical Risk Minimization},
  author = {Steve Hanneke and Mingyue Xu},
  journal= {arXiv preprint arXiv:2412.02810},
  year   = {2025}
}

备注

This paper has been accepted to the 38th Conference on Neural Information Processing Systems (NeurIPS 2024)