中文

恶意噪声下半空间的属性高效学习:近最优标签复杂度与噪声容忍度

机器学习 2021-03-03 v5 数据结构与算法 机器学习

摘要

本文关注噪声下Rd\mathbb{R}^d中齐次稀疏半空间的计算高效学习。尽管近期工作在各类标签噪声(如有界噪声)下建立了属性高效学习算法,但在具有挑战性的恶意噪声模型下,何时及如何高效学习ss-稀疏半空间仍是一个开放问题,其中 adversary 可能同时破坏无标签样本与标签。我们肯定地回答了该问题,设计了一种计算高效的主动学习算法,在(未损坏)无标签样本上的分布为各向同性对数凹的假设下,具有近最优标签复杂度O~(slog4dϵ)\tilde{O}\big({s \log^4 \frac d \epsilon} \big)与噪声容忍度η=Ω(ϵ)\eta = \Omega(\epsilon),其中ϵ(0,1)\epsilon \in (0, 1)为目标错误率。我们的算法可直接调整用于被动学习设置,并且我们展示其样本复杂度为O~(1ϵs2log5d)\tilde{O}\big({\frac 1 \epsilon s^2 \log^5 d} \big),同样具有属性高效性。我们的主要技术包括用于样本重加权的属性高效范式、用于经验风险最小化的属性高效范式,以及对无界数据的一致集中性的新分析——所有这些均关键地考虑了底层半空间的结构。

关键词

引用

@article{arxiv.2006.03781,
  title  = {Attribute-Efficient Learning of Halfspaces with Malicious Noise: Near-Optimal Label Complexity and Noise Tolerance},
  author = {Jie Shen and Chicheng Zhang},
  journal= {arXiv preprint arXiv:2006.03781},
  year   = {2021}
}

备注

V1/V2 had a problematic argument on polynomial-time solvability of a form of sparse principal component analysis. V3 fixed it by using a new approach based on semidefinite programming. V4/V5 polishes the writing and is accepted to ALT 2021