中文

不可知多组主动学习

机器学习 2023-06-06 v1

摘要

受改进人群中子集(稀有或困难)分类准确率问题的启发,近期出现了以泛化至代表各“组”的分布集合为目标的学习模型研究兴趣。我们从主动学习视角考虑该问题的一个变体,其中学习器被赋予从集合中各分布决定标注哪些样本的能力,目标是在保持 PAC 学习保证的同时最小化标注查询次数。我们的主要挑战在于,基于分歧的主动学习等标准主动学习技术不能直接应用于多组学习目标。我们修改现有算法,为不可知多组学习公式提供一致的主动学习算法:给定 GG 个分布集合与 VC 维为 dd 的假设类 H\mathcal{H},该算法使用 O~((ν2/ϵ2+1)GdθG2log2(1/ϵ)+Glog(1/ϵ)/ϵ2)\tilde{O}\left( (\nu^2/\epsilon^2+1) G d \theta_{\mathcal{G}}^2 \log^2(1/\epsilon) + G\log(1/\epsilon)/\epsilon^2 \right) 次标注查询输出 ϵ\epsilon-最优假设,其中 θG\theta_{\mathcal{G}} 为集合上最坏情形分歧系数。粗略而言,在基于分歧的主动学习算法可望成功且组数不太大的情形下,该保证优于标准多组学习的标注复杂度。我们还考虑集合中各分布相对 H\mathcal{H} 单独可实现的情形,并证明此情形下 O~(GdθGlog(1/ϵ))\tilde{O}\left( G d \theta_{\mathcal{G}} \log(1/\epsilon) \right) 次标注查询足以学习。我们进一步受组分可实现策略启发,给出全不可知情形的一个近似结果。

关键词

引用

@article{arxiv.2306.01922,
  title  = {Agnostic Multi-Group Active Learning},
  author = {Nick Rittler and Kamalika Chaudhuri},
  journal= {arXiv preprint arXiv:2306.01922},
  year   = {2023}
}