中文

从众包中高效 PAC 学习

机器学习 2017-04-17 v2 数据结构与算法

摘要

近年来,众包已成为为学习算法收集带标签训练数据的首选方法。众包的标准方法将获取带标签数据的过程与从收集到的数据中学习分类器的过程分开看待。这可能会引发计算和统计上的挑战。例如,在大多数情况下,尚无已知的高效计算学习算法能够对众包数据中存在的高水平噪声具有鲁棒性,而通过投票消除噪声的努力通常需要对每个样本进行大量查询。在本文中,我们展示了如何通过交错标记和学习过程,在标记成本开销小得多的情况下实现计算效率。具体而言,我们考虑在 F\mathcal{F} 中存在真实目标函数的可实现设定,并考虑一个标注者池。当一部分显著的标注者是完美的,而其余的标注者行为任意时,我们证明了任何在传统可实现 PAC 模型中可以被高效学习的 F\mathcal{F},都可以通过向众包查询以计算高效的方式被学习,尽管响应中存在大量噪声。此外,我们证明了这可以在每个标注者只标记恒定数量的样本,且平均每个样本请求的标签数量为常数的情况下完成。当不存在完美的标注者时,一个相关的任务是寻找一组良好但不完美的标注者。我们证明了,当至少大多数标注者是良好的时,我们可以识别出所有良好的标注者。

关键词

引用

@article{arxiv.1703.07432,
  title  = {Efficient PAC Learning from the Crowd},
  author = {Pranjal Awasthi and Avrim Blum and Nika Haghtalab and Yishay Mansour},
  journal= {arXiv preprint arXiv:1703.07432},
  year   = {2017}
}