中文

对抗性多源PAC学习的样本复杂度

机器学习 2020-07-01 v2 机器学习

摘要

我们研究从多个不可信数据源学习的问题,鉴于众包与协作学习范式的最新出现,这一场景的实际相关性日益增加。具体而言,我们分析学习系统从多个源获取数据集的情况,其中某些源可能存在偏差甚至被对抗性扰动。已知在单源情形下,能够破坏固定比例训练数据的对手可阻止PAC可学习性,即即使在无限多训练数据的极限下,任何学习系统都无法接近最优测试误差。在本工作中我们表明,令人惊讶的是,在多源设定中同样情况不成立,其中对手可任意破坏固定比例的数据源。我们的主要结果是一个为该学习设定提供有限样本保证的泛化界,以及相应的下界。除了确立PAC可学习性外,我们的结果还表明,在协作学习设定中,即便某些参与者是恶意的,与其他方共享数据也具有可证明的益处。

关键词

引用

@article{arxiv.2002.10384,
  title  = {On the Sample Complexity of Adversarial Multi-Source PAC Learning},
  author = {Nikola Konstantinov and Elias Frantar and Dan Alistarh and Christoph H. Lampert},
  journal= {arXiv preprint arXiv:2002.10384},
  year   = {2020}
}

备注

International Conference on Machine Learning (ICML) 2020: Camera-ready. Strengthened the definition of adversarial PAC-learnability, added explicit bounds on sample complexity