中文

重新审视无监督 PAC 学习

机器学习 2024-07-30 v1 数据结构与算法 统计理论 机器学习 统计理论

摘要

PAC 学习源于 Valiant 于 1984 年和 Vapnik、Chervonenkis 于 1964、1974 年的工作,是研究监督学习的经典模型。在无监督设置下,我们获得假设集合 H\mathcal{H} 和来自未知分布 D\mathcal{D} 的标记样本训练集 (x1,y1),,(xn,yn)X×{1,1}(x_1,y_1),\dots,(x_n,y_n) \in \mathcal{X} \times \{-1,1\}。目标是产生一个分类器 h:X{1,1}h : \mathcal{X} \to \{-1,1\},其预测标签 yy 的错误概率与在 H\mathcal{H} 中错误概率最低的假设 hDh^\star_{\mathcal{D}} 相当。经验风险最小化 (ERM) 是一种自然的学习算法,即输出在训练数据上犯错最少的假设。该简单算法已知在 VC 维度和样本数 nn 的条件下具有最优误差。本文重新审视无监督 PAC 学习,首次表明 ERM 实际上是次优的,如果将最佳假设的性能 τ:=PrD[hD(x)y]\tau:=\Pr_{\mathcal{D}}[h^\star_{\mathcal{D}}(x) \neq y] 作为参数。具体而言,我们表明 ERM 以及任何其他 proper 学习算法都次优,次优因子为 ln(1/τ)\sqrt{\ln(1/\tau)}。随后,我们通过首个实现 nearly 完全范围内最优误差的学习算法来补足该下界。我们的算法引入了若干新思想,期待这些思想将在学习理论中找到进一步的应用。

关键词

引用

@article{arxiv.2407.19777,
  title  = {Revisiting Agnostic PAC Learning},
  author = {Steve Hanneke and Kasper Green Larsen and Nikita Zhivotovskiy},
  journal= {arXiv preprint arXiv:2407.19777},
  year   = {2024}
}