中文

细粒度依赖分布的机器学习曲线

机器学习 2022-11-14 v2 计算复杂性 机器学习

摘要

学习曲线将学习算法的期望误差绘制为其从目标分布接收的标记样本数量的函数。它们被广泛用作算法性能的度量,但经典 PAC 学习理论无法解释其行为。正如 Antos 和 Lugosi(1996,1998)所观察到的,经典的“没有免费午餐”下界仅描绘了所有特定目标分布的学习曲线之上的上包络。对于 VC 维为 dd 的概念类,经典界以 d/nd/n 衰减,然而有可能\emph{每个}特定分布的学习曲线都呈指数衰减。在这种情况下,对于每个 nn 都存在一个不同的“困难”分布需要 d/nd/n 个样本。Antos 和 Lugosi 提出疑问:哪些概念类承认“强极小极大下界”——即对无穷多个 nn 固定分布成立的 d/nd'/n 下界。我们以原则性方式解决了该问题,通过引入一种称为 VCL 的组合维度来刻画使得 d/nd'/n 为强极小极大下界的最佳 dd'。我们的刻画加强了 Bousquet、Hanneke、Moran、van Handel 和 Yehudayoff(2021)的下界,并通过表明对于具有有限 VCL 的类,学习率可分解为仅依赖于假设类的线性分量和还依赖于目标分布的指数分量,精炼了他们的学习曲线理论。作为推论,我们恢复了 Antos 和 Lugosi(1996,1998)关于 Rd\mathbb{R}^d 中半空间的下界。最后,为了提供对我们工作及其与传统 PAC 学习界比较的另一视角,我们还以更接近 PAC 设定的语言给出了结果的另一种表述。

关键词

引用

@article{arxiv.2208.14615,
  title  = {Fine-Grained Distribution-Dependent Learning Curves},
  author = {Olivier Bousquet and Steve Hanneke and Shay Moran and Jonathan Shafer and Ilya Tolstikhin},
  journal= {arXiv preprint arXiv:2208.14615},
  year   = {2022}
}