重新审视无监督 PAC 学习
机器学习
2024-07-30 v1 数据结构与算法
统计理论
机器学习
统计理论
摘要
PAC 学习源于 Valiant 于 1984 年和 Vapnik、Chervonenkis 于 1964、1974 年的工作,是研究监督学习的经典模型。在无监督设置下,我们获得假设集合 和来自未知分布 的标记样本训练集 。目标是产生一个分类器 ,其预测标签 的错误概率与在 中错误概率最低的假设 相当。经验风险最小化 (ERM) 是一种自然的学习算法,即输出在训练数据上犯错最少的假设。该简单算法已知在 VC 维度和样本数 的条件下具有最优误差。本文重新审视无监督 PAC 学习,首次表明 ERM 实际上是次优的,如果将最佳假设的性能 作为参数。具体而言,我们表明 ERM 以及任何其他 proper 学习算法都次优,次优因子为 。随后,我们通过首个实现 nearly 完全范围内最优误差的学习算法来补足该下界。我们的算法引入了若干新思想,期待这些思想将在学习理论中找到进一步的应用。
引用
@article{arxiv.2407.19777,
title = {Revisiting Agnostic PAC Learning},
author = {Steve Hanneke and Kasper Green Larsen and Nikita Zhivotovskiy},
journal= {arXiv preprint arXiv:2407.19777},
year = {2024}
}